{"as_of":"2026-08-17T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16e282ae1dc3b6aaff075a1bf538e1e3a459417bb9d712092009015b9a2e5ed1","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:58:50.730090Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:38:28.328436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:35:47.308416Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"cited_work":{"arxiv_id":"2602.06422","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06422","snapshot_observed_at":"2026-07-07T03:18:12.085101Z","title":"Alleviating sparse rewards by modeling step-wise and long-term sampling effects in flow-based grpo.arXiv preprint arXiv:2602.06422, 2026","venue":null,"work_id":"87ffc566-e1fe-479a-a55b-74e845bf3042","year":2026},"citing_paper":{"arxiv_id":"2605.15190","last_updated":"2026-05-14T17:59:30Z","snapshot_observed_at":"2026-08-14T05:48:28.777866Z","submitted_at":"2026-05-14T17:59:30Z","title":"RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-30T20:38:28.328436Z"},"links":{"cited_paper":"/paper/2602.06422","citing_paper":"/paper/2605.15190"},"observation_digest":"sha256:b743e477dc52e4f66a46125878dae39bc8fc5a7ecf0ab5696b247868dd89c017","observation_id":"72c1ca81-5a6e-46b9-912c-239b718f6730","resolution":{"observed_at":"2026-07-07T03:18:12.085101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.06422/citation-record","integrity":"/paper/2602.06422/integrity","json":"/paper/2602.06422/citation-record.json","paper":"/paper/2602.06422"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-03T03:58:48.478031Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.478031Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:09bfba394efb576186b51301511f45c12182b25d5fbe3457077699ebf28c4ba8","observation_id":"cd4823fd-3f9a-4bc0-8804-05f6c0a19a57","resolution":{"observed_at":"2026-08-03T03:58:48.478031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:50.730090Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.730090Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:bb48fc1644be0a48c5a42217081fc7a20b36a79395ab0bfda99846d8615d97f9","observation_id":"97819a72-f58a-435f-a44d-2f374c6a8b0a","resolution":{"observed_at":"2026-08-03T03:58:50.730090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-08-03T03:58:48.835551Z","title":"Seedream 2.0: A native chinese-english bilingual image generation foundation model.arXiv preprint arXiv:2503.07703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.835551Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:ca7f94f78169f158ccf897ea0262b8a929233f0ae066475e1dd347aefc8fcb52","observation_id":"2e78b1ca-bb65-4826-9c13-564fee38b66d","resolution":{"observed_at":"2026-08-03T03:58:48.835551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T03:58:48.943935Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.943935Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:8a917231f3c84e4ad46ae9429876edd937ea673f3cdf0c9d04c245aecd03e473","observation_id":"90896383-cba7-480c-8ca7-4346902e1dca","resolution":{"observed_at":"2026-08-03T03:58:48.943935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04324","last_updated":"2025-10-15T06:35:29Z","snapshot_observed_at":"2026-08-16T13:24:28.207284Z","submitted_at":"2025-08-06T11:10:39Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04324","snapshot_observed_at":"2026-08-03T03:58:49.067234Z","title":"Tempflow-grpo: When timing matters for grpo in flow models.arXiv preprint arXiv:2508.04324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.067234Z"},"links":{"cited_paper":"/paper/2508.04324","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:5accf2233d0a4ea1e38b5e1f29134effaf4324f6e39d9c238bc6ff2116e3a7d8","observation_id":"f2b5f785-2e51-4051-a603-adbd2bd6ba1d","resolution":{"observed_at":"2026-08-03T03:58:49.067234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:50.688606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.688606Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:9ef2d2624e2c4f84402e127e3e5cf140089ff295dfcfb43864942d689f4b60fb","observation_id":"5be4e67f-1567-4acd-9a94-175afaf311c8","resolution":{"observed_at":"2026-08-03T03:58:50.688606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-15T05:27:54.901099Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-03T03:58:49.354792Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.354792Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:a6d797196abf676ea0366d6167fea74c7804a12c96580b8cd55b7ef8536e6208","observation_id":"cde24e99-d1f6-4383-bea0-86b457ff8e3d","resolution":{"observed_at":"2026-08-03T03:58:49.354792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T03:58:49.455396Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.455396Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:c701d4e977c36aa25f258327464bbbeaf9002abb026cadcdb9326faa1544d52e","observation_id":"d3bd812a-b04d-4bc6-ae04-74353ab868a8","resolution":{"observed_at":"2026-08-03T03:58:49.455396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-13T10:15:00.293616Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-03T03:58:49.630032Z","title":"Flow-grpo: Training flow matching models via online rl.arXiv preprint arXiv:2505.05470,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.630032Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:0679752498941b17d21712f2c1729aa30ccadd99f1e68fd1c881eaa4eb429f72","observation_id":"d961a994-2c86-4e5e-9bca-f7390645d529","resolution":{"observed_at":"2026-08-03T03:58:49.630032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T03:58:49.747831Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.747831Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:9528b2ee93d1b36dde789f536b0b2f8d57c4c9daeacbab4b1257d321d14a6bdb","observation_id":"6e4b85ed-65c1-4eec-8794-4dff5e214a8d","resolution":{"observed_at":"2026-08-03T03:58:49.747831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:50.127534Z","title":"Grpo-guard: Mitigating implicit over-optimization in flow matching via regulated clipping.arXiv preprint arXiv:2510.22319, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.127534Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:78fabdc40e1a0d17e4bd7ca9494fb9f94b1d198c69203215881b44f778ed4f0e","observation_id":"639bd713-4120-44cb-adc5-b7d95bd6d50b","resolution":{"observed_at":"2026-08-03T03:58:50.127534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-08-15T21:26:30.952106Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-03T03:58:50.281427Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.281427Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:066497be58b9b0f5dd61818ac36404170739f20c69f6af0e28038d0d65f70a39","observation_id":"a50eaa08-f5fb-4fdf-bef9-62c3a9ba542a","resolution":{"observed_at":"2026-08-03T03:58:50.281427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T03:58:50.427811Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.427811Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:21c90b484efd3ae9f9cb2b12f477fdad80a9483c27f6a640870b2492a5226589","observation_id":"33790b14-018f-4f69-ada6-8934bee8ee34","resolution":{"observed_at":"2026-08-03T03:58:50.427811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-03T03:58:50.564346Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.564346Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:22b7e0212eb4c9316a172342c175d579cfc266fc6d105d087f2d4fe4463dfd66","observation_id":"9f97412d-913d-4f1d-a1f2-cb5ea11b10c7","resolution":{"observed_at":"2026-08-03T03:58:50.564346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T03:58:50.055891Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:50.055891Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:853a7247fddf95f5dbdb8a2b284666cbcce78ca021dbea16a4b91ee10ece1d32","observation_id":"5fe96f48-1dd4-4a36-9acf-bbd97a657803","resolution":{"observed_at":"2026-08-03T03:58:50.055891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T03:58:49.865910Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.865910Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:7bc0daad7edcf25f96633de21e8bfbb4dcd505e39cb635a964df3262efd95d9c","observation_id":"cdac7abf-3952-4199-803f-d6e647d6d7c0","resolution":{"observed_at":"2026-08-03T03:58:49.865910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T03:58:49.120237Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.120237Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:8a1ab7ea6f51b6e328c9161e860fd6bdef7cef40c88ce535e1474e4de8267612","observation_id":"9b7e307a-80b3-4b1a-b673-c4319ec040da","resolution":{"observed_at":"2026-08-03T03:58:49.120237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-08-14T05:24:51.715708Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-08-03T03:58:48.541300Z","title":"Paddleocr 3.0 technical report.arXiv preprint arXiv:2507.05595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.541300Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:1574fcb525f0658d9c71b14d4720ae5222af921fe2f990a04373a5d6e6e52dcb","observation_id":"c77a963d-838a-47de-9571-b24da31e2d72","resolution":{"observed_at":"2026-08-03T03:58:48.541300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02507","last_updated":"2024-12-19T10:43:11Z","snapshot_observed_at":"2026-08-16T13:46:11.340525Z","submitted_at":"2024-06-04T17:25:59Z","title":"Guiding a Diffusion Model with a Bad Version of Itself","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02507","snapshot_observed_at":"2026-08-03T03:58:49.195604Z","title":"Kirstain, Y ., Polyak, A., Singer, U., Matiana, S., Penna, J., and Levy, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:49.195604Z"},"links":{"cited_paper":"/paper/2406.02507","citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:c617ffcc20751545d926b200835a5d9819f0a03075f60edbc1f3fc62b0e52058","observation_id":"777f14c1-41b3-445c-ac38-471d792bea4d","resolution":{"observed_at":"2026-08-03T03:58:49.195604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:58:48.719811Z","title":"Densegrpo: From sparse to dense re- ward for flow matching model alignment.arXiv preprint arXiv:2601.20218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:58:48.719811Z"},"links":{"citing_paper":"/paper/2602.06422"},"observation_digest":"sha256:6e4aa7f1e09eb0a9a6ac0ac939ec9e192dcd0ebc036e059f58932e1598b18a4c","observation_id":"89b3d90f-74de-4370-8b2b-36f1f8542440","resolution":{"observed_at":"2026-08-03T03:58:48.719811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06422","last_updated":"2026-07-05T22:38:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:35:37.303209Z","submitted_at":"2026-02-06T06:37:10Z","title":"Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2602.06422."}