{"as_of":"2026-08-16T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17f035eb9c174e818b33ab3518bc0e226665eae72681da2ff4414fcec5c201b3","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:17:30.974692Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:49:55.058885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2606.06096 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:df91353ec9498df3d142c45170afd1ca4f20857736afd0899e37d34a5c8ef6c7","observation_id":"6896b378-7fed-44bd-b6f8-dcd0c1a30cb5","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-08-02T00:41:12.561057Z","title":"OrderGrad: Optimizing beyond the mean with order-statistic policy gradient estimation.arXiv preprint arXiv:2606.06096, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14962","last_updated":"2026-07-16T13:14:21Z","snapshot_observed_at":"2026-08-14T02:06:21.782867Z","submitted_at":"2026-07-16T13:14:21Z","title":"Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:12.561057Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2607.14962"},"observation_digest":"sha256:9edfb50b77aea565834e101feb25452382928781e6eab4b471f187f397100602","observation_id":"61c207e2-3e47-44ae-a1b7-dae906663094","resolution":{"observed_at":"2026-08-02T00:41:12.561057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-08-04T00:49:55.058885Z","title":"2606.06096 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00296","last_updated":"2026-07-31T21:11:48Z","snapshot_observed_at":"2026-08-14T22:24:16.233151Z","submitted_at":"2026-07-31T21:11:48Z","title":"Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T00:49:55.058885Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2608.00296"},"observation_digest":"sha256:a748af4716128521eb9841b6fac148f5539b609783db401e7f62e42f01771c26","observation_id":"f65710a9-e0cd-46d2-9e9c-bdffc8fa8711","resolution":{"observed_at":"2026-08-04T00:49:55.058885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.06096/citation-record","integrity":"/paper/2606.06096/integrity","json":"/paper/2606.06096/citation-record.json","paper":"/paper/2606.06096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0efcf9ec6410b121a9a9ad20dabd7bd4a14806aee17bff9b486938df3d9ed0b8","observation_id":"6bbe41e9-c457-4f14-920c-82a18c47909f","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Tasche, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:34c04d5534f3a4ad72a1deac73409d8d8c1c3d184fb3356f99d051388318a81d","observation_id":"67372aeb-1a9a-4e8c-b557-a2d193af377b","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Tasche, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4b2f8428f1413535bfa8c8833487621be5bb980ffcf6ab2dee80270d7c023b98","observation_id":"8b6ad3c3-2312-4ad6-b21f-f67ff584f00d","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"S., Courville, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5f00c2fc5032e2f145d156623b3af20f4f8abd69dea41cd83ee5949fc48c592d","observation_id":"d734e41d-c2d3-417e-9e9a-4926572df2dc","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:56dab49124919d10bf9e34196b45d7aa4856a89d04a3d706e2518def6fa81eb1","observation_id":"a8d38442-5171-4cd7-9f1f-616052ba1482","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"C., Balakrishnan, N., and Nagaraja, H","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4ba0791a5a054d052151a59749167e57c5494c00bb531a5e38489a1f8baaab74","observation_id":"0e9dc0e8-2467-4616-a2c4-77519f1d3772","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:320961c7f410166050ad526c16f2a829e33ad9781d0d88134850b5a0a0a6a0f1","observation_id":"ed458d4d-2b50-4855-a16a-068d74a833ea","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:56.995100Z","title":"The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation","venue":null,"work_id":"92afd1d0-76d7-404f-bb98-a521406f2c18","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c8dc9a2741f9ede9395c8cc10cb180d8c7554881221b2b751eb6276fb80aa2f3","observation_id":"eed8db11-6ae5-4a2d-9b05-9405149729da","resolution":{"observed_at":"2026-07-02T12:16:56.997320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"W., Budden, D., Dabney, W., Horgan, D., Dhruva, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5731f163f0f198ee042cd0a39bcf3204b87b8a82bcb95ce4e98443227baf7785","observation_id":"8be19c04-74d7-47f6-b0fd-69d903612004","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7ebfa4ea97c57281615dd157f5342dd43bbb094ef3b9be5b3e62893264deba07","observation_id":"c03f5b8a-27a6-4bcf-9d5a-7e7e1fb32cb2","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., Dabney, W., and Rowland, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:41869df5c1e5f94dfa0c64df3def9b7ccb9de662f1cd9846bca9a445369a8add","observation_id":"e4c2d222-876e-467c-bbb1-80cf0a0cc093","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b03daa0a5ab698b81f16831463f3ca07e8d122757468a8107b7a80609a9039e0","observation_id":"5f61ab70-1e4c-4b68-9837-e85bb3ca9da2","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:57.011864Z","title":"Post-training as reweighting: A stochastic view of reasoning trajectories in language models","venue":null,"work_id":"8c3af321-88c8-423e-84f7-acaa90a08cbb","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:759b4d7ae662fa355adf6306df695a0d7e8b1fd4ffe6b20e693b046ce025b680","observation_id":"6fed56f6-89cc-4ad9-bb07-21ea0d69d622","resolution":{"observed_at":"2026-07-02T12:16:57.013582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ba32e813fde1b938b07467596586b16f273b91e83f3927f26b6f380f849cf650","observation_id":"a19832b1-e827-45fa-a9ac-bf417fe9fe36","resolution":{"observed_at":"2026-07-02T12:16:57.010748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7444ff0b0e933cffbd406354d392fe04ab17f60a77c75ae46a2afe92376e3dbd","observation_id":"6e07ee2f-1a3a-41bf-a214-2692d2c51cdb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0556cad32146b6b58963cd550cf95f7d07f7e33684e813ed75100fcb3fdab646","observation_id":"bf266e16-1f0e-4beb-aa2b-53b43d7cb0ac","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:38:56.018423Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":"6a468d06-b0b2-4d32-85fd-004b5cb11cc7","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b7a20d8550551c121c8e512065cb0477a4669195e5d2fe0199f6821bea35c4bf","observation_id":"1fd8f441-5de7-408b-9bc6-08fa8cb0c68e","resolution":{"observed_at":"2026-07-02T12:16:56.988341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:48e0fe96778d0ea52fea993651a7c1074a1d33a3c47dae947b69e385bc630914","observation_id":"1488be54-a811-486c-99e9-7a5ac8d5a57b","resolution":{"observed_at":"2026-07-02T12:16:56.990950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:266daf5856bc94feeaa8accb4f8cd05c38197658676c0634645dac6abb043148","observation_id":"742e7457-58dc-4252-90bd-f8328b9c11b5","resolution":{"observed_at":"2026-07-02T12:16:56.976361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-08-16T12:42:28.642795Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:dbc111c9177e8f48cb1d2ebd7ba51b436f51f7ea2179e1bd25ab959a31d587b8","observation_id":"1c3865e6-26ba-4ba3-9b5f-a6c6e499abc3","resolution":{"observed_at":"2026-07-02T12:16:57.019055Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6c59ea220114ec85858a65c2378bdbed4f65237400bd84d108df68ad19aa3bdf","observation_id":"36a0bd92-68f0-4357-84e1-0bd2ea533a84","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4c96b126aea686a5dc631e1a9864fcb11eb85ab3df6c860867110c96dfaf4596","observation_id":"a20b1c02-b180-454f-b135-13ecaaefcd35","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:682974fa1a169173ae1763d72e3277b620fb69f796360276d2594e715c5d10c2","observation_id":"ca39b96c-61e0-444e-901a-9a0fad101445","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5aca449fc11039f3d47b45629c08eea223c4a3b4970ef36235f891409a3f5bef","observation_id":"3508b074-851f-4c04-8f83-eb4b4f598bdc","resolution":{"observed_at":"2026-07-02T12:16:57.021716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"Y ., Jegelka, S., and Krause, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4c40b0857da8c17974b4a9720d8c18af121e8e9300b7169826d32ff98cdaac21","observation_id":"f763a0cc-b51b-45be-a953-a99ac413ffac","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c8da6ac000eeaf48bc87508025197116a9bc390076c8f5fd18b49ee8c6bd989e","observation_id":"409765b5-2fde-487a-8bda-19691b9bda7e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., and Munos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:26af07765b720aff53696dea9f8972774ad3c39797c6a82ebe459153708ea320","observation_id":"9aa3947d-975c-444e-98b1-f8ca28a6633c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:8fe1011418adb3e15ae84724dd5232897faa8ca61544f1b1d7070466012f8cb3","observation_id":"caf1c61f-194c-4cff-952d-45736a1b9343","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4348e1603465da82aab0cc7272350b9bcef51fac46c61a544c6eff927bfbc7a3","observation_id":"a394e4ba-cb6a-4371-afd0-3cad2a1afd05","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c3c3652a3a31d6ee9c647e64336866bd4f834f49229ed62b570221c74557929c","observation_id":"7542aff4-d641-4550-ab89-5bb7ad8db0ca","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.186056Z","title":"arXiv preprint arXiv:2505.17621 , year=","venue":null,"work_id":"035ff294-c5e5-4e88-ae7a-0df158e76e15","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a5406aeeb5d83c75fe1813013b884648c2f29347321ed670b1dc6518f0b07a1d","observation_id":"71d004ed-24c6-44e5-9be7-c7ffa6695944","resolution":{"observed_at":"2026-07-02T12:16:57.024503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:690475bbf9b9f34c88c34226997828ce9f72c05af767802b10d7638d00296890","observation_id":"fcce7173-ccef-4383-ade1-37a4c2d6d446","resolution":{"observed_at":"2026-07-02T12:16:57.027162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:681c64c040f9ae662b6a92e76ab177c7bbf6571967dd3f27b97f57882b9d06a3","observation_id":"39634bea-8030-4353-8a14-f3064ea6f4eb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4eb431b64b2be7080fd0ef2703962ffcfd71c2e7187cd186ed07b08a481b0971","observation_id":"46d03bed-f440-4ded-ba3a-f1b6e0979fc9","resolution":{"observed_at":"2026-07-02T12:16:57.016459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"W., Fried, D., and Welleck, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:38d3cc7e27e93cd16a2c67034b7c6dca6c2107761e78396e307aebfc1b8f6379","observation_id":"13892c65-42a6-49f2-bc6b-0658da879580","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:68ac80ff17ffb059f43828e6fcec4123143618e14cd00ace5ee7bc955ba9cc96","observation_id":"9fafb7de-e62c-4899-9c74-2a93f1656105","resolution":{"observed_at":"2026-07-02T12:16:57.029462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:61780779b1c5edcbfa99845d6957d18dfa98e878928be9d814da0ad75a0abe31","observation_id":"18d09a0b-86b8-4d59-8d44-b996997d5cee","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b797555206769866db49f7732dc1fd3b43600f74d1f5c39908c7fdf10cd11029","observation_id":"e6ae0a11-c0c6-4e12-b5f9-c17f385aa5df","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:b3b673ca2e24259b4294bb5724da4e5866fc13153e114007b972f19160ccdf1e","observation_id":"6d6d0b61-e21e-41ea-8e9b-7370b65312db","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e941e933767264aef88d1eeed9ba317ac66e7bba5b34cdd593dbe220b41c2ecc","observation_id":"00b0c7e0-a956-4c99-892e-8928f9b3951e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23629","last_updated":"2026-05-07T02:29:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T04:10:37Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","version":3},"cited_work":{"arxiv_id":"2509.23629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23629","snapshot_observed_at":"2026-07-10T11:37:03.356545Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","venue":"cs.AI","work_id":"82ef2feb-9982-4d37-bac4-f9efd152cbce","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.23629","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:752a3744474b8efa45f7074e5b409496bd6e81afd0137d4356b747165f97eef7","observation_id":"9c7dff10-a709-4c6f-9d85-ba27ac8b7fac","resolution":{"observed_at":"2026-07-02T12:16:56.947312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:86f28000b50581be504a296ac216440fd7b3e049ac7b3e9272260c23d06d77e7","observation_id":"4fb6ba7f-4d7f-4932-953d-d0ed1baa6e42","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:cf0733d8498fb953a6a2e814e14274f8f0d6d3b8cf26bc9b3197bbd66da30607","observation_id":"23e435fb-24b5-4bbe-914f-a260c9b40ad8","resolution":{"observed_at":"2026-07-02T12:16:56.941459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.299960Z","title":"arXiv preprint arXiv:2509.25133 , year=","venue":null,"work_id":"27ca51ae-e57f-4f13-9b0c-155064ec727b","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7db840fbdd3f056cc7838b6f05f16846a82569f02ffb98d7c5a0d28b687b68f4","observation_id":"98b231ad-f53c-4d69-ab6d-712a30b8dd52","resolution":{"observed_at":"2026-07-02T12:16:56.955387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0e53053eb1df3eff3ea5fbcb813649879599aef7d0ae7a4464a325d9a0519788","observation_id":"d638f6b4-867f-40f6-858c-d3beea050cf0","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1e6b91f76fabb02153c8f92fb90db7e08c6dcd57c26ba164b7722c0f48edecf0","observation_id":"272c2537-9058-4dc8-a382-654e2f0ca9a8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:9f21e3f33be76d8d21b1764d4f125d941b8ae0492673bca8ba7014759c84b9d6","observation_id":"3589b422-e57f-42c8-b3b2-334b8f4abbd8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:bb2147b0e4f3ebb86ada5f6a327d5bb2257a327c58d0ddd43d5a19f784f5a87f","observation_id":"78e959cf-3164-40bd-afdc-a82d9627c7f8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3fa85bfdce954b248cfd2d6ff18bf4d9da6cb95fbd093da03b2f188ab51ed764","observation_id":"0e9b16a8-13c6-4e23-95ea-facf7c89e15c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7f2996f31e6fc97927a685e55ec49ee1622de50b2f8130c88457b78376c26e10","observation_id":"d15ad7bf-d25e-4e40-b78c-f27a85c75a2c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a4a337b2f7d710c47b82c42ef15e37b6d4b7c01b593ade540a46a040ed03c64e","observation_id":"1c0a6fd1-2f1d-4454-a872-e5b23f2bd29e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"J., Dohan, D., Dyer, E., Michalewski, H., Ramasesh, V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a326e08fa2e117361705ed40508ca35b40157421863102f17a7fea1fc0b743ad","observation_id":"9766548b-9624-466e-94dc-8525bc3afc8f","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-15T16:35:01.753469Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e23abaaad26bcfd6cbdb41118b0f1a823e20861c28e8a4348654f9a52050c089","observation_id":"3670faa7-ac27-4631-b212-00732dcaccf4","resolution":{"observed_at":"2026-07-02T12:16:56.970665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.372600Z","title":"Can llms guide their own exploration? gradient-guided reinforcement learning for llm reasoning","venue":null,"work_id":"2a20b1ce-d30e-4599-9057-c9f6932478b7","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:169f4d6bd2a40d0177d7bba2fe60a943044b5a948259cabe08d135080359f500","observation_id":"9019fbe1-78ef-4763-a57b-0c26f0bbe288","resolution":{"observed_at":"2026-07-02T12:16:57.038294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:a5b62ff717d99aedab049d96ceeba1802723a7e55caa4746fbbb9f048ec61bd6","observation_id":"ae639a4d-aa39-4baa-bfa9-0b79027870ae","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Mendelson, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:5cd17d12ecfb86adde3c0111f94af37c4d4a735fcf373ff8c46d354596935b77","observation_id":"625f52d9-d87e-4203-b868-445bb8edead4","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., and Castro, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c843ee2f058618c4085af80d86bdb58abab79d8596220eddbb523053a2a71411","observation_id":"d8983f42-171f-47aa-a584-d2012c607de9","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3d80e10259b677c0bf82cf5e5f5922c5541ea0ae5aaafa175c3318dff431280e","observation_id":"00748d4d-6460-4689-b947-ed3a125f0071","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"A., Paudice, A., and Pontil, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:33b5bd39f764f696fd63cd6cecb49b4b5755774892a51b95b98dc89dba91aeb8","observation_id":"42fd3e5e-01ee-4e2d-9447-2b59e0b22559","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e17a41b635cae321ed9c1705414c727552bf92e6981cd1c36d29eb17f32dbfa4","observation_id":"d3c720cc-365d-4fdb-8f9d-61b1a536758a","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Rezende, D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:0d6fb6e13f6c9a40e930ce32be0db5fec5ced9cc697ba9b89739f035e9bed9f0","observation_id":"0807f02e-bc03-4d3b-a724-32f4c6fc45ac","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:831e094808d51ff8dd4c3d85254f682748e16b985b447b621b7a541f4e80ddd2","observation_id":"4025a78d-b25f-400e-99ea-087605a219bb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:2e2da105650f19e8cff30c4715f9a8d22bed62e8830b26f41233625dacfc3861","observation_id":"5ed2b147-4755-4f53-becb-57c6d150ae70","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:2b25b87bf45ba26acc270fc92ee8c713717f9d546294653adc381e182dabd67a","observation_id":"03f5c51e-1469-4234-874a-21e2a4a87cca","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:617c5b60f0dc774ca47133ed233b4e0c574bda82575f6f35fc0125d74c78e5b2","observation_id":"ccf89d13-ded4-4b4f-8fee-bb8911bfd741","resolution":{"observed_at":"2026-07-02T12:16:56.985569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:6fc047c8a4e653e22f57f5df72c515857f423ab3b4dd3e13c06b6ea2cb4abcee","observation_id":"a679b167-5a0e-4a51-b5ee-d29384f3d52d","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e0b1f61690d74d2815d171e308f5dfe500e1fb5f5058f8bb30d15c6e975c58b5","observation_id":"9647f19b-b66b-4b1b-b610-53d5aac30c62","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Tamir, A","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:843d5a674c462522d4335412494ca72f1127e560e89a19bfb0b33925590672f4","observation_id":"6b263c29-38b7-479d-aa92-a2b9b6888a89","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:14ad1e2b6de314c59e32feb0957f444dc1713054383576e59665587572eb8c08","observation_id":"c74060a8-830f-4b02-9856-42a131df3793","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":"1910.07113","doi":"10.48550/arxiv.1910.07113","metadata_source":"pith","pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Rubik's Cube with a Robot Hand","venue":"cs.LG","work_id":"81bf9cee-6de8-49f6-b967-3cb853e5ba67","year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:40b0138a304555b872f3027a6246522609533d270a3bcd84e6a641499d6dbe9e","observation_id":"f79f92d3-68de-466b-867b-49f33019373f","resolution":{"observed_at":"2026-07-02T12:16:56.958620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:898fbd121aea1726a690696abbe7b1edebaf8defdc2b616ed47ae7fbcafc513e","observation_id":"ce49015f-1f6d-4d6c-84f7-711e95b0b001","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:fd791e2afe626e6ce046407244042a35f2c6a578d2e698abac52ecb2cac4a090","observation_id":"366f7fe5-0f55-4a60-bd85-cb0cdfcbc022","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"E., Peters, J., and Doya, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1db6f92ea392fd58e414c351264c023f3ea9e6894958d59e400291168be0020b","observation_id":"31d081c9-15af-4a00-b9dc-1e2f6a7fe52c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Seno, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:dd0daae4a3196590f3e0357ddfb1b497c64ca365de2c1e5000959a25ea32dbe4","observation_id":"d63b31ca-4516-4fdc-a7fb-d255de1e28bb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Sugiyama, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:aa5df816153e654ff0606b3da3a7ba85f3c953d32907dbab14a6c4138fa16f7e","observation_id":"48bce378-adb6-4362-a12b-305d0e744023","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3c0abeaece4dc7ae76a15c86f17732700cc6ef36af13b09b823bc4cbfdb16cdf","observation_id":"15b98f5c-1854-47f1-a3f0-8c48c9c161f8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:18cf12d027d4a8885611eaefc85a554a586c5e51bcfdf8f22f0e9f2a08c4439f","observation_id":"5665ea70-ae1c-4788-af9a-821f9dc27232","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"J., Mohamed, S., and Wierstra, D","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:93b34f9f6da6d2a94b49a6c8553f68e10733ccac92f24a375b1d6d56681ccd27","observation_id":"f9f164ab-8727-48bb-950c-eca4c0fae80d","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:4ae5397a64b4a1736549ed3f89a53927fcf83368a2506bb53852e5a49c1b161d","observation_id":"762b100a-b9d1-449c-897e-9cfcb64e726e","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:1a8cdf869027c9471f63981312e38ff12204bf6118e145997500d38e14dc14f0","observation_id":"e7a4de8a-e39d-44bd-918e-a5ce461b9080","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., Dabney, W., Munos, R., and Teh, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:7fd2462d0194836d894227a3d1e51f6874b7154ec7ea96da9c16c76b45722a78","observation_id":"9802d0fd-3880-406a-a74e-1e3427e73094","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"G., and Dabney, W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:99f47e25f1cb6a0223263d123a28f9f07680484b95e7c72d05bf00d9fba05a10","observation_id":"be2acb0c-fd65-4995-8ecb-78065e3b6f21","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-14T00:13:00.965119Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:54b5a2698f3d72d9186b3a205a98593cd10d1933e18c8034d5a92240876ae355","observation_id":"18fc5695-e22c-4d53-9796-fff3c94285ae","resolution":{"observed_at":"2026-07-02T12:16:56.964580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-16T12:43:48.435094Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":"2504.04022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-07-05T10:20:57.237283Z","title":"Rethinking reflection in pre- training.arXiv preprint arXiv:2504.04022","venue":null,"work_id":"dd1b4e9d-9546-4ae2-80c3-4c45b9cf7b90","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c65786eec9f87a3df51720b72ce707bfeb0389ebfd6f4ce10be6226b0ece4f2c","observation_id":"cecee2b2-8406-4f3c-8593-80399a10b817","resolution":{"observed_at":"2026-07-02T12:16:56.961703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Wexler, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:cde9055fbdd50b42f23107a574efe37ac40bbb7e7cda1d0a2ac46cb72e2e3d2a","observation_id":"f96994a6-6f4e-4f8a-a684-bdd6ee636f34","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:ff3a350e1608c3d7db99fe5adddae898af751f838823ebb46c8edfdf0e125c61","observation_id":"df998907-4508-4892-83b2-740c5a2795e1","resolution":{"observed_at":"2026-07-02T12:16:56.993763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:266366a5dae99eedc6a97a6967de081209832db562c27cb01a0e27dda221557e","observation_id":"45222633-c3e5-4ff7-be95-c38ad2ed293c","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d7c49d868a32b89d326bf165e5372ba85472ac54bbd039406d5b0f4c9ecbc99e","observation_id":"dcd92603-873f-47ff-bb13-15e92155bbd8","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Sanghavi, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:3e63e551652c03590c73ffefc98cdbf5efb444096cb4a4c621fc863b7c287b1b","observation_id":"16bb2b31-70fd-4f6b-a9b3-4f2dfaea7c4f","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:573998303cc7048e2e44ff15647c4e227d76e1f7fa5191c9d5861dd15a6b5a05","observation_id":"a8126bf8-e979-40d1-a9e8-ef3344887b16","resolution":{"observed_at":"2026-07-02T12:16:56.999981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"M., Foster, D., and Ghai, U","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e2a2d75e966e13a51f376153027079253fb7d867c5617e93daadf3396d9e4039","observation_id":"c5026d0c-818f-4ffd-b6fd-53933f5ceb13","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"M., Lowe, R., V oss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:c783597f8eb4319e29addae377cc3369a98d631f5faa2394006faa95e742a68d","observation_id":"7cbba2a4-979f-4a9d-a91f-c5bae3d4a6f5","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:880d948bc42f152a5c8c6e918145bc4dc301417ab8635111da775bf49f3f1194","observation_id":"4382454d-d04e-47b3-970c-44f0e977c931","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:2a9c73a382ffe5c82123363215a95e535776588ac289e58872d1f1507e3af8c3","observation_id":"6091ce7d-dbbd-47a3-9618-c718f9da7b99","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:9d963f6b99ffca6cdbe3e248f756104a84ca8fa91cdd4092cb8f357a5e6858f3","observation_id":"13be03e1-bbe2-431c-92d7-0d7d73db1684","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-16T19:51:32.275150Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:8c6e1e9e86854072fc17809fe32dbf9c5e0cc59c167dd3ae2ff9985afb952989","observation_id":"c6196c4d-4b05-4577-9504-dfebd55d8b57","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"and Karkhanis, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:75ad46037cb5e8dac78a48360b4c6ffda2d85dd2746f3d6519eb2e47c221dbea","observation_id":"52c6e4ae-7cdd-4b4b-87ca-dacc612433ee","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":"A., Le, Q., Diao, E., Zhou, J., Ding, J., and Anwar, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:2d7e91a6f72f43ce5355841bf66e7fff25b6f7257da982dde01bf1858189cf05","observation_id":"14bc830f-7cf5-414e-be80-85bdfbde41bb","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:156c4882b964622966a09d1908f3bc12d90834a95c955c99d6e79c4aaba4eb9f","observation_id":"32374512-3c5e-4da4-bf6d-26d1d08dc426","resolution":{"observed_at":"2026-07-02T12:16:56.982648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:17:30.974692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:eaf8f389730813e3d9079876fd23050770d6bcf9086d85014358fe5332d99a68","observation_id":"31dd2fcf-c01c-48a3-9055-5dfd79f5f970","resolution":{"observed_at":"2026-06-28T02:17:30.974692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":75,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 3 inbound Pith citation observations for arXiv:2606.06096."}