{"as_of":"2026-08-21T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd7c668ff9a40566c6627d7c8bf322e564e3b23550dabf54b1dd6af748cbf9ee","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:01:24.023367Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:26:49.821867Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.22950","doi":"10.48550/arxiv.2506.22950","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https: //doi.org/10.48550/arXiv.2506.22950","venue":"ArXiv.org","work_id":"97ff21b5-2812-4cf3-a5d4-b9513b859a15","year":null},"citing_paper":{"arxiv_id":"2605.22537","last_updated":"2026-05-21T14:25:24Z","snapshot_observed_at":"2026-08-13T08:54:25.401943Z","submitted_at":"2026-05-21T14:25:24Z","title":"F-TIS: Harnessing Diverse Models in Collaborative GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T07:40:35.113858Z"},"links":{"cited_paper":"/paper/2506.22950","citing_paper":"/paper/2605.22537"},"observation_digest":"sha256:2e2763296e003b2154729d8cf489723cf317395754ca06213c57609add89404f","observation_id":"9cd97a3e-0019-4e55-a89f-21905f666d43","resolution":{"observed_at":"2026-05-22T07:41:14.382554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22950","snapshot_observed_at":"2026-08-15T14:26:49.821867Z","title":"Infinite sampling: Ef- ficient and stable grouped rl training for large language models.arXiv preprint arXiv:2506.22950, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10402","last_updated":"2026-08-11T02:49:33Z","snapshot_observed_at":"2026-08-20T11:51:22.600442Z","submitted_at":"2026-08-11T02:49:33Z","title":"TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:26:49.821867Z"},"links":{"cited_paper":"/paper/2506.22950","citing_paper":"/paper/2608.10402"},"observation_digest":"sha256:855a7aaa4ea7aeea0232faf7310fdf5e959184e1edc35bf512180d3212663fe0","observation_id":"5e194027-7fbd-4cf7-816b-ace09f840c68","resolution":{"observed_at":"2026-08-15T14:26:49.821867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22950/citation-record","integrity":"/paper/2506.22950/integrity","json":"/paper/2506.22950/citation-record.json","paper":"/paper/2506.22950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:01:23.593717Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.593717Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:810f68d7b7a076f0afbb3391c9e8f6e5871a3c3cb93a90708c1fb399676a1a61","observation_id":"ae54f573-f745-4daf-ba65-108b384d61d9","resolution":{"observed_at":"2026-08-06T22:01:23.593717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:25.025118Z","title":null,"venue":null,"work_id":"712a8224-b037-49b3-a705-4149aa83e726","year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.600719Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:4597db5e284e935654a5267f7c43e5289ec86f981a3a2494616aff761d322a21","observation_id":"a0ffcfce-48fd-4696-8714-fe408679f181","resolution":{"observed_at":"2026-08-06T22:01:25.031292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T22:01:23.612403Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.612403Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:ef11ee8e020b3955b2c43549133b2b5efd23f716801ed5a871618b918d23f06d","observation_id":"35687e8f-703a-4f9d-a023-0057372a4b2d","resolution":{"observed_at":"2026-08-06T22:01:23.612403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T22:01:23.617039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.617039Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:8a705ced23fcab2f2a20756ea016635719a16a36cc798182954043c7b4727dc9","observation_id":"1fd0fafb-220a-499d-8d60-0cd0fefc6f90","resolution":{"observed_at":"2026-08-06T22:01:23.617039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-06T22:01:23.623374Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.623374Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:8d663fea6d711ccee0c289f3433f9e2f929f7e5e0720c41b5dd7d179bb8f3038","observation_id":"9ce02750-4d96-4171-96db-47d2b1064493","resolution":{"observed_at":"2026-08-06T22:01:23.623374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T22:01:23.629095Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.629095Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:2601c8c4f8a3fbf4a4fd09a11e6402164d1f3dff4563ff7e0a8925be98c5a44b","observation_id":"02ca16c4-bb02-4f1a-9a5d-807e42616aab","resolution":{"observed_at":"2026-08-06T22:01:23.629095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T22:01:23.637326Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.637326Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:7ed510110bdda8ebb2dea847467277d59add3c738adaeebeaf7484f0cbca9cb0","observation_id":"7873e5f0-ff6d-4453-90e0-d934f9058916","resolution":{"observed_at":"2026-08-06T22:01:23.637326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:24.996291Z","title":null,"venue":null,"work_id":"f9580e66-18e3-4909-b7db-981ddb8c5213","year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.643295Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:8ed86cfc70150dc3f49c5614dbc8c5a1dc5080cc32130b5f256dcf4173271d77","observation_id":"7ab8bd83-868e-4506-8a6c-85bd7c9ace69","resolution":{"observed_at":"2026-08-06T22:01:25.004161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:01:23.653086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.653086Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:ea4c68540353daf0430640da214c363a6782d7a53701f21e0ea6652105a0d7dc","observation_id":"21cdab9b-a7df-42a8-b479-38dd412f7c39","resolution":{"observed_at":"2026-08-06T22:01:23.653086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T22:01:23.648438Z","title":"arXiv:2505.24298 [cs.LG] https://arxiv.org/abs/2505.24298","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.648438Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:d7491e04486763882837a48ad04c70224301801015fae1b32f62e1ff6e7d5e73","observation_id":"91e4a796-2636-4899-b357-0aaf145a915b","resolution":{"observed_at":"2026-08-06T22:01:23.648438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.668619Z","title":null,"venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.668619Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:d705d4f5af02c1239d56bfa8879a491f2c33df776103cf742dec0adafe268162","observation_id":"e2a12bd6-bce4-45fc-a22b-36429e1786d8","resolution":{"observed_at":"2026-08-06T22:01:23.668619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:24.976280Z","title":null,"venue":null,"work_id":"fcdd4419-1b9f-4dcb-a80d-075b542ea935","year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.657733Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:0750a64d4178a98962bd67f2410cbde87f958d6450e4b9ff8792d69552a2e452","observation_id":"c0a218a9-1eb2-46de-ad02-6bbad8992223","resolution":{"observed_at":"2026-08-06T22:01:24.980796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T22:01:23.678791Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.678791Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:00192711427ee3929d4cf3ddc4f00473c35ba0e67fc636426b5517afd85d08cd","observation_id":"3a7bf3c4-4390-4b18-83b9-b8bd7623e577","resolution":{"observed_at":"2026-08-06T22:01:23.678791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:24.946978Z","title":null,"venue":null,"work_id":"e8c79e9d-66f9-451c-abe7-4ef85cb7be4e","year":1949},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.683935Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:b21ca794623b2ad94c228649e3a2b5eee8353c2e405351bd103b93e5f8a89bf0","observation_id":"e5c73d4f-ed82-425e-bdd1-a28487e13bd2","resolution":{"observed_at":"2026-08-06T22:01:24.951744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-06T22:01:23.672951Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.672951Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:59cde82973e24655b54fa059e23de91e5b8c726ef6f74179988507607c808684","observation_id":"0324c5d3-8bfb-43a9-b25e-f78c9f0978cd","resolution":{"observed_at":"2026-08-06T22:01:23.672951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T22:01:23.696728Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.696728Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:c2abdfad170a9b72eb36a45f8856bf28d9d665939c271d2ca233ccbbde953eb8","observation_id":"83df7646-07b1-49a2-8b27-64def2f8506a","resolution":{"observed_at":"2026-08-06T22:01:23.696728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-06T22:01:23.701288Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.701288Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:f305c2baad84a579df94f8567fb9704449bfe7c634abb7ceff56106605d6afc8","observation_id":"556c831d-9d4d-4ebb-a79a-5b862a0c33b8","resolution":{"observed_at":"2026-08-06T22:01:23.701288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.691994Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.691994Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:2889c1cf92a85a1258dc70233f0efae0fbe87a7cc0b6932e5636cbaf26a9f2c0","observation_id":"1b26baf4-b9f6-4004-89de-59e4080fa7a5","resolution":{"observed_at":"2026-08-06T22:01:23.691994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.716259Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.716259Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:6be9a86f1d8780b6721ba81d9c5765a30d9dd59342c720ce92a6d9dbfd046d92","observation_id":"075eb96c-3cca-4954-8d59-bee904c6f77b","resolution":{"observed_at":"2026-08-06T22:01:23.716259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T22:01:23.722022Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.722022Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:9242d02992548eb5b9e54abc554f79d115354cb2b695e113dc12238294fae8bb","observation_id":"e24bbe5b-553d-4f20-8d0e-ab7256611dc3","resolution":{"observed_at":"2026-08-06T22:01:23.722022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:24.914513Z","title":"Kalbarczyk, Tamer Başar, and Ravishankar K","venue":null,"work_id":"e2f968d6-d1df-4bc2-af35-aa02070e6df4","year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.706120Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:442eb0c58e76cf13b8d827b27402e8ee45abb1c1547d0b9083cbd4c728710783","observation_id":"e501a27e-f3b9-4dd4-a11f-b5cb318a822c","resolution":{"observed_at":"2026-08-06T22:01:24.923125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08509","last_updated":"2024-11-25T17:35:07Z","snapshot_observed_at":"2026-08-19T00:38:58.889292Z","submitted_at":"2024-04-12T14:46:15Z","title":"Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08509","snapshot_observed_at":"2026-08-06T22:01:23.711196Z","title":"arXiv:2404.08509 [cs.DC] https://arxiv.org/abs/2404.08509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.711196Z"},"links":{"cited_paper":"/paper/2404.08509","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:bdd8f11dece6bd9e9a2da3e2d6d550ccf5129c8d29f9196e93eaeb9469fc30e2","observation_id":"7831e371-0d79-4ee5-8c34-0a809bbc6b12","resolution":{"observed_at":"2026-08-06T22:01:23.711196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.740249Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.740249Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:793dd25d414ca8a3af8634315ac6fb566c99beb2553d85f91b58ee7a9ba42ab3","observation_id":"6342af0b-bbc0-4141-996f-1ae6c8fbad3a","resolution":{"observed_at":"2026-08-06T22:01:23.740249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.749311Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.749311Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:cdd6877ec400668d8c4a3f25d47b4fc7aea1e91aee3b85cd8b24538510df390f","observation_id":"752630ae-3137-4788-a1d3-27aaf5239c58","resolution":{"observed_at":"2026-08-06T22:01:23.749311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-06T22:01:23.728685Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.728685Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:cfcb474044c2720dd5be7e3e328390c5731f88eca57f6107d52641bed8e328eb","observation_id":"526b10c1-46cf-4202-9774-2f0bc85bace8","resolution":{"observed_at":"2026-08-06T22:01:23.728685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07857","last_updated":"2021-04-16T02:22:12Z","snapshot_observed_at":"2026-08-20T04:38:53.502515Z","submitted_at":"2021-04-16T02:22:12Z","title":"ZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07857","snapshot_observed_at":"2026-08-06T22:01:23.734112Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.734112Z"},"links":{"cited_paper":"/paper/2104.07857","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:61a61f689a17fd8acf0dd727d01742c8fa50d2ee80166182497f0f75f251a46e","observation_id":"e2b3638e-38a1-4326-946c-6c6f81a290f7","resolution":{"observed_at":"2026-08-06T22:01:23.734112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-16T13:31:06.995791Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T22:01:23.768568Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.768568Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:8d40fe1335d8b1acd434eeba655e4b75e97948f8705580717cbd26f68b05860b","observation_id":"461a5b00-b6bf-454a-900d-d65b113bee91","resolution":{"observed_at":"2026-08-06T22:01:23.768568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:01:23.773742Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.773742Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:dfd4d2ab40ea68cb3c7627d1cf0feed7c466061cfc29d5222d997e1099f1174a","observation_id":"e8c2a1ec-fe9e-4a25-8d62-26aaef5ee500","resolution":{"observed_at":"2026-08-06T22:01:23.773742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T22:01:23.778031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.778031Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:dd10e505b81fde74f399a644f3b7a8a46ebd34bc4f94b1ee892be6297c37303d","observation_id":"43b9d60f-dec3-466c-932b-8145eee0f448","resolution":{"observed_at":"2026-08-06T22:01:23.778031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-08-19T12:25:16.688145Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-06T22:01:23.782702Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.782702Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:c5fbb88378bc00609ed8f3601e5f04f168e96f5bafaddf505b26619f4f6d2d4a","observation_id":"5058069b-c939-46af-9846-4f54c05fc867","resolution":{"observed_at":"2026-08-06T22:01:23.782702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:01:23.760043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.760043Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:19619241f5d395667d6187eeeda019d5fc3912ceab32f4e51b0fb2a7019caafb","observation_id":"1ca1adcf-f569-4157-91bf-3b52a2fd4607","resolution":{"observed_at":"2026-08-06T22:01:23.760043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.764379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.764379Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:3bd1b35a0b8c20a4b132aee5ec096bcb19b98a45e2189d2435e6ff95ef3ee6e5","observation_id":"f3b65236-2515-4339-9181-4264bc3c47bf","resolution":{"observed_at":"2026-08-06T22:01:23.764379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-06T22:01:23.812966Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.812966Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:2c12c25b2a30f08c4f63939c9e2c3ac2872c04a12cb51f73bc9db77d4fd2c149","observation_id":"fe41b33c-e4ed-4d4c-b436-b80dc72d7493","resolution":{"observed_at":"2026-08-06T22:01:23.812966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.837341Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.837341Z"},"links":{"citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:7f72e2db68482890ecf6c6c432f9e09e99174e76f8e56e5a90a193ecb826fcdd","observation_id":"dfb51034-43cd-4758-80a4-22ac06a00aa4","resolution":{"observed_at":"2026-08-06T22:01:23.837341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-20T01:49:19.844891Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-06T22:01:24.023367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:24.023367Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:c7ab4e0525513458a824ab5aaaa84d35b240f1c7b35f0f89658012cbe5db6335","observation_id":"09a90acc-3fd0-4efd-8eda-2e08a99ff9bb","resolution":{"observed_at":"2026-08-06T22:01:24.023367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T22:01:23.788123Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.788123Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:d89e46614fd084d10cbe108c233197572755877bdcbd8d57b5f6e0d8b582660d","observation_id":"3a569497-5cc8-4f5e-89d9-40f93c10517d","resolution":{"observed_at":"2026-08-06T22:01:23.788123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-08-20T15:46:44.516034Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-06T22:01:23.797749Z","title":"P Xing, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.797749Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:6819df5841b0bebf2a44118524faa756978e95e34eb49ad173541a78faa507ae","observation_id":"0abfcd2f-2d7b-478b-bbc5-bb11e48aa632","resolution":{"observed_at":"2026-08-06T22:01:23.797749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03594","last_updated":"2026-04-22T15:33:51Z","snapshot_observed_at":"2026-08-17T14:15:25.018905Z","submitted_at":"2024-11-29T05:57:37Z","title":"BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03594","snapshot_observed_at":"2026-08-06T22:01:23.849216Z","title":"arXiv:2412.03594 [cs.CL] https://arxiv.org/abs/2412.03594","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.849216Z"},"links":{"cited_paper":"/paper/2412.03594","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:84adadba43aab7dcd4dfbfe4c927ad88c362c3478de32b818f84bf72e72c6b01","observation_id":"584b6f7e-317a-418d-96e6-b6d1030f27e3","resolution":{"observed_at":"2026-08-06T22:01:23.849216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:01:23.755199Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.755199Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:8b3e845ae19900cf1a6ea0448cb4508e4ed9037957d59ca7302d5b64c40fddaa","observation_id":"f353a0ea-3b89-42f4-bdd7-4bd10b908e8e","resolution":{"observed_at":"2026-08-06T22:01:23.755199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T22:01:23.744845Z","title":"arXiv:1506.02438 [cs.LG] https://arxiv.org/abs/1506.02438","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.744845Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:bf560b94fae1a4384956e128a2f5522c02482fba5f98e5e3c10dbff48acaaa69","observation_id":"5e13f927-1c64-4418-a0bd-da4134782729","resolution":{"observed_at":"2026-08-06T22:01:23.744845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04504","last_updated":"2026-08-17T00:01:33Z","snapshot_observed_at":"2026-08-20T23:11:50.074747Z","submitted_at":"2024-12-03T03:16:12Z","title":"Multi-Bin Batching for Increasing LLM Inference Throughput","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04504","snapshot_observed_at":"2026-08-06T22:01:23.662435Z","title":"arXiv:2412.04504 [cs.CL] https://arxiv.org/abs/2412.04504","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.662435Z"},"links":{"cited_paper":"/paper/2412.04504","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:14130e52fa16041259f14869554be6e40c2c2aef77dcf3a33dfb2c7ed56e563d","observation_id":"0226e5e9-c2e2-4ecc-b316-0636eeba918c","resolution":{"observed_at":"2026-08-06T22:01:23.662435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09142","last_updated":"2025-05-14T04:50:00Z","snapshot_observed_at":"2026-08-20T11:38:17.029715Z","submitted_at":"2025-05-14T04:50:00Z","title":"ELIS: Efficient LLM Iterative Scheduling System with Response Length Predictor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09142","snapshot_observed_at":"2026-08-06T22:01:23.606728Z","title":"arXiv:2505.09142 [cs.DC] https://arxiv.org/abs/2505.09142","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.606728Z"},"links":{"cited_paper":"/paper/2505.09142","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:605da51e95c166f16bdcaa3726f6f3ec4ae9ed72b32384bb8eae11500423b07e","observation_id":"3b90de7b-6217-4c90-9730-19029bdad7de","resolution":{"observed_at":"2026-08-06T22:01:23.606728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2506.22950."}