{"as_of":"2026-08-17T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca40c0eb2648f27985d3e6b1aa741f274cc650328b6140294ef275ffb7d21f22","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:00.193690Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17823/citation-record","integrity":"/paper/2607.17823/integrity","json":"/paper/2607.17823/citation-record.json","paper":"/paper/2607.17823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.575378Z","title":"Max k-armed bandit: On the extremehunter algorithm and beyond","venue":null,"work_id":"30e9ffd3-c1f4-42b5-aa00-eabf88c6a9d7","year":2017},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.853729Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:58d6a9e30d9016ce3aa01375d5686fdff3f78cb5132da71156e7d9200e3ad702","observation_id":"625e53fa-f725-4c3a-a903-19d02bb5b830","resolution":{"observed_at":"2026-08-15T15:43:01.580651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.858827Z","title":"Model-based reinforcement learning with a generative model is minimax optimal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.858827Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:4df4e8901d222f3ed9d32502a1ade75254fc9e18ba5db026479c1d063bd5aacb","observation_id":"07c00da6-1cb9-440b-9610-ffd8202ec4ab","resolution":{"observed_at":"2026-08-15T15:42:59.858827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.550254Z","title":"Rewarding behaviors","venue":null,"work_id":"b2b05ec0-c772-4f77-a140-a42f1622f1ad","year":1996},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.864050Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2b244730360b00d5e0e7d9b257c583712cc3bdb58b789f33f035f8e67a7434f1","observation_id":"47162232-2a07-4dee-a51e-1d65eeabdc70","resolution":{"observed_at":"2026-08-15T15:43:01.555000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.868809Z","title":"The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.868809Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:5bb6965e4afa0f16df7230a2d689ebeb77423e82ae47b2ce8f71035afbbd7244","observation_id":"f49fc2c4-5a51-461c-98c8-991e1fc12ad8","resolution":{"observed_at":"2026-08-15T15:42:59.868809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.532962Z","title":"Optimal rates for feasible payoff set estimation in games","venue":null,"work_id":"292fd0f5-aba3-42c4-9b04-6b6ab85df3ab","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.873641Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:927408a571b1752ebf219c0d927b4f6f2e249fdb1614576f07ae409313a989ac","observation_id":"8fd909a1-f7e5-4b00-84f3-c6bd2d5cb84b","resolution":{"observed_at":"2026-08-15T15:43:01.538800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.517332Z","title":"Regret bounds for risk-sensitive reinforcement learning","venue":null,"work_id":"e0bd4a00-7a7d-4834-b1f1-789734e8e9e1","year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.878445Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:47d4220d78c27f879d65a95861333e26b61420cd43d70cbd68f4ec9f02ef871e","observation_id":"dc095108-3c1e-42c3-9fbc-567fd533d0f8","resolution":{"observed_at":"2026-08-15T15:43:01.522317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10883","last_updated":"2022-03-21T11:09:34Z","snapshot_observed_at":"2026-08-16T17:13:03.285167Z","submitted_at":"2022-03-21T11:09:34Z","title":"Efficient Algorithms for Extreme Bandits","version":1},"cited_work":{"arxiv_id":"2203.10883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10883","snapshot_observed_at":"2026-08-15T15:43:00.841509Z","title":"Efficient Algorithms for Extreme Bandits","venue":"cs.LG","work_id":"9b6d28b1-d91e-407b-bd92-842add7b78df","year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.883304Z"},"links":{"cited_paper":"/paper/2203.10883","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:b18571a243f14d5ba9df42a4dd72300b38f497527151ed99319d36b93e7a82b0","observation_id":"1b93c90e-f45a-484d-a499-3ff7ac0d225a","resolution":{"observed_at":"2026-08-15T15:43:00.847060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.501291Z","title":"A distributional perspective on reinforcement learning","venue":null,"work_id":"26da360b-9664-489a-9129-37db1d84c300","year":2017},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.888682Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:25be1622daebbdb5f0dc8f4c79f326a9f194db8bbbd2f27c387657895a625dc5","observation_id":"1eb87b60-46ee-479d-82c1-a39110c44967","resolution":{"observed_at":"2026-08-15T15:43:01.506394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.893132Z","title":"Distributional reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.893132Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:f809c468518d8f50b3fc54f5de4062423ec7f23a408074f916ee15c32843b590","observation_id":"922f4659-6ee2-4e0e-beb0-e2f7211de686","resolution":{"observed_at":"2026-08-15T15:42:59.893132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.475381Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"3f2ad1c3-d2a6-4857-8ebe-db71c0a61835","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.897682Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3922465ae8a067972faa34a91bd5f945b713509a630ef53d92576789504cf528","observation_id":"562fbd03-df68-4cdf-8a0e-3e55637ccec0","resolution":{"observed_at":"2026-08-15T15:43:01.480410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.460138Z","title":"Concentration inequalities","venue":null,"work_id":"f340c0fd-21ef-4e82-a801-dbf83d3dc686","year":2003},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.902824Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:83507c6a3214a4d47fdf27a7b253be3850784dc3a297b33c7c65bd0ec73e345b","observation_id":"76f0cb61-4bc6-43ed-8015-1a75c354c82b","resolution":{"observed_at":"2026-08-15T15:43:01.464927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.443894Z","title":"Ltlf/ldlf non-markovian rewards","venue":null,"work_id":"74400724-f9ba-493d-a74e-5010be286f21","year":2018},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.907794Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:49c7be95fb704de25f9e19fa1b27f62fadf704200cd0ead2095c8aec271eff24","observation_id":"bb58fe7f-850f-4322-bbcd-dc3597d8f089","resolution":{"observed_at":"2026-08-15T15:43:01.449399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-15T15:42:59.913259Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.913259Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:4b2545c684024f319f57fffd523cdf213b2fb186a590da1892da7b928460d013","observation_id":"9fdfe351-46f4-495d-8ed8-4d466b2f21d0","resolution":{"observed_at":"2026-08-15T15:42:59.913259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.427654Z","title":"Extreme bandits","venue":null,"work_id":"ffb842d7-f623-4903-8526-542a3dd55cdc","year":2014},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.919440Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:335a808886ef526afa4c4aa1f8b8dbc737e559f5865fcc1fb390ae48348a2b35","observation_id":"0a285c5d-5d23-4918-b36b-cabf9dd18427","resolution":{"observed_at":"2026-08-15T15:43:01.432510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13473","last_updated":"2026-06-11T15:27:06Z","snapshot_observed_at":"2026-07-06T23:52:14.348914Z","submitted_at":"2026-06-11T15:27:06Z","title":"MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2606.13473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13473","snapshot_observed_at":"2026-08-15T15:43:00.800242Z","title":"MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Population-Level Test-Time Scaling","venue":"cs.LG","work_id":"2b8657f8-5e1d-4c11-9e45-22663dfdc813","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.924047Z"},"links":{"cited_paper":"/paper/2606.13473","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:0800e698d794d00ee28cb2f327b1b3f9090f297de80e2b86a38800d6d45ef0bd","observation_id":"bfeca6e3-9d90-4053-8ae5-038570ccd3c0","resolution":{"observed_at":"2026-08-15T15:43:00.805866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T15:42:59.928939Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.928939Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2679c584b92e8003a7df2e5702b4f7263e0954b863d8880ed220609d87f88b28","observation_id":"40355f6a-ae50-479c-bbf6-c3036bc00e10","resolution":{"observed_at":"2026-08-15T15:42:59.928939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-15T15:42:59.933543Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.933543Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:f3097ae3d73f24c14364e951a32ad24a421009cd41126b5cdf9f94b99c845f89","observation_id":"2671270e-a7bf-4526-b5e5-6280f75f798a","resolution":{"observed_at":"2026-08-15T15:42:59.933543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.411142Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? Advances in Neural Information Processing Systems, 38: 0 57654--57689, 2026 b","venue":null,"work_id":"708886e7-76ac-4450-866a-b83ad1c299cc","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.938646Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:255fb958adf179ba8630e5f331bbe12ccff685040de4bb45e6cffe3419990316","observation_id":"7b5455b1-d8ff-47a6-8215-6104926b509b","resolution":{"observed_at":"2026-08-15T15:43:01.416408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.391471Z","title":"Robust reinforcement learning with general utility","venue":null,"work_id":"9b3ae73e-b6c1-4b89-b31d-304cef8eefd9","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.945161Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:cd9a52f7bb7e29f952e2c8cba67615a37d1022c5b0ab07855794339a77cf938a","observation_id":"8554e31f-2321-4536-b3c6-5be9d4c27a01","resolution":{"observed_at":"2026-08-15T15:43:01.396413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.375745Z","title":"Algorithms for cvar optimization in mdps","venue":null,"work_id":"6c6fb662-104d-4b57-a4e3-e5abc02ba719","year":2014},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.950006Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:80c805286e8169d2f1599979d4c2e2765144ee9b156ae6fe2f04fd5cdae468e9","observation_id":"a2533bf9-107f-4c86-9d69-6d7ce6a91b78","resolution":{"observed_at":"2026-08-15T15:43:01.381109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.359050Z","title":"Inference-aware fine-tuning for best-of-n sampling in large language models","venue":null,"work_id":"223d7e50-9627-4924-9280-42404ce95754","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.954810Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2722ebaf17328d8ee8044ed409f09b156455b9578d3b9b3ee1b8094847b959a2","observation_id":"aa071919-3714-43e4-b0ad-7743923b2799","resolution":{"observed_at":"2026-08-15T15:43:01.364580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06468","last_updated":"2026-06-04T17:54:44Z","snapshot_observed_at":"2026-08-13T13:43:20.358068Z","submitted_at":"2026-06-04T17:54:44Z","title":"Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement","version":1},"cited_work":{"arxiv_id":"2606.06468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06468","snapshot_observed_at":"2026-08-15T15:43:00.746910Z","title":"Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement","venue":"cs.AI","work_id":"b0566056-6624-456a-9c62-ac106ebdfaf9","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.959235Z"},"links":{"cited_paper":"/paper/2606.06468","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:9058091d4983c18b06db68ec5bf8b61c47c32e8dd89467250194088c4e8b1fee","observation_id":"629f9abf-1e80-4559-8c7a-5bf323b82482","resolution":{"observed_at":"2026-08-15T15:43:00.752025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T15:42:59.964054Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.964054Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:89b8fe2c2b9e337f0130cfa0e2b2760cccea62299cc1d5f8da3560507d5f809e","observation_id":"8c2f4e4c-eadd-4214-ace6-6e0ff1a60848","resolution":{"observed_at":"2026-08-15T15:42:59.964054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-15T15:42:59.969022Z","title":"The entropy mechanism of reinforcement learning for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.969022Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:a54fdac09a2109dd996909ccc265e36caf3c6ba926aa9cc7025d9aa1b211aeee","observation_id":"e929eea7-8113-492b-9198-5cd1bc497a9d","resolution":{"observed_at":"2026-08-15T15:42:59.969022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.973762Z","title":"Distributional reinforcement learning with quantile regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.973762Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:93afd5d4d0a16c86f8547f97f8c4be8ac8dac4fc1e0b01ada6ad26148d1bd6eb","observation_id":"a57f932b-0639-4867-bf20-391465791a64","resolution":{"observed_at":"2026-08-15T15:42:59.973762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.332313Z","title":"Sample complexity of episodic fixed-horizon reinforcement learning","venue":null,"work_id":"e0dd62e6-39ee-49e8-bbdf-935abfe007ed","year":2015},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.978206Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2826d8f5b33e756c63e78fbb937a6d7d3964efdb6e0c05fa4e030514411bdd2d","observation_id":"6c1b5b99-2c8c-4610-8596-d6b86f17a714","resolution":{"observed_at":"2026-08-15T15:43:01.337404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.316167Z","title":"Chain-of-verification reduces hallucination in large language models","venue":null,"work_id":"b99e2a4d-25a9-481a-a604-5e4f1859fdb2","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.982838Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:f95c1c8a89b41a636ad08f1dd116795988672d8b1de191e2c87de0cd1e88ac31","observation_id":"71c59548-95e2-44ce-b301-6399e4e4a8ed","resolution":{"observed_at":"2026-08-15T15:43:01.321369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:42:59.987481Z","title":"Episodic reinforcement learning in finite mdps: Minimax lower bounds revisited","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.987481Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:09f8cec0a9827a57cb9376d348bf5704c9348c6a8c1e9f4526096f0b0c6d5c27","observation_id":"0b9aa258-404a-4eb5-9628-71baec40fa45","resolution":{"observed_at":"2026-08-15T15:42:59.987481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.289747Z","title":"Risk-sensitive reinforcement learning: Near-optimal risk-sample tradeoff in regret","venue":null,"work_id":"f4b64316-a9a0-483e-9b5f-fb82dae00937","year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.991888Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:93b979def6c2bcfc335669c15ae467970ae7b23ee7b7ba9f07e7a53bf44d6b14","observation_id":"a6cdc281-69f9-4117-b890-a96d3ca60546","resolution":{"observed_at":"2026-08-15T15:43:01.294545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.274929Z","title":"Reinforcement learning with non-markovian rewards","venue":null,"work_id":"d8653114-16c8-4f50-ab8b-1f9d54532e64","year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:42:59.996244Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:504a4a53ce7b60925f073284e8c8440647bf6408db8aacf2827c6dadc3b04dcf","observation_id":"59853193-3c51-4bf3-8d76-b54f8961256d","resolution":{"observed_at":"2026-08-15T15:43:01.279736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.259168Z","title":"Explore first, exploit next: The true shape of regret in bandit problems","venue":null,"work_id":"232e048e-ed9d-43f4-9914-e5840589aa24","year":2019},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.000917Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:9c6c93fca590a73d6d705334db5f4bb18c2052835f171f59cd14e34536edb6df","observation_id":"6f889ea7-c8bb-4e4e-9bbe-35fafa7a31b9","resolution":{"observed_at":"2026-08-15T15:43:01.264333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.006056Z","title":"Minimax pac bounds on the sample complexity of reinforcement learning with a generative model","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.006056Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:6552640ca8803f66636b802a100ad51a9e9e026ae4151191c91da21f6fd2cfd4","observation_id":"7c2ef413-981c-447a-876a-4ad6be31dd22","resolution":{"observed_at":"2026-08-15T15:43:00.006056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:43:00.011209Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.011209Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:9b4f76542b3cb07c4888c3d39ee2caffc0eaff07c0c7c60e7cc2e154fd090c86","observation_id":"668552ad-4f7a-4bb7-9d75-c4183ec9e73e","resolution":{"observed_at":"2026-08-15T15:43:00.011209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.233618Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"901eb33c-b4aa-431f-9ece-9ad171562a95","year":2019},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.016167Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:4c438fe54f103b6bab43d4e7bc8aeeb74241fe7628d19d89c043eb87d8a9739f","observation_id":"5f55e9cc-c7e8-479d-9d3d-9372759007d4","resolution":{"observed_at":"2026-08-15T15:43:01.238724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.021277Z","title":"Reward machines: Exploiting reward function structure in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.021277Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:2ae29ed77b216809c31a19732b8a7d2cd0214dcd90d708aed41a89f85fd5d6f9","observation_id":"17730fc1-6c16-4a39-a6f1-762ade99ac0d","resolution":{"observed_at":"2026-08-15T15:43:00.021277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17912","last_updated":"2026-04-20T07:42:22Z","snapshot_observed_at":"2026-08-12T20:40:29.796485Z","submitted_at":"2026-04-20T07:42:22Z","title":"Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2604.17912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.17912","snapshot_observed_at":"2026-08-15T15:43:00.675834Z","title":"Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought","venue":"cs.LG","work_id":"187faf38-8479-49ec-8d53-33b908b6fb19","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.025992Z"},"links":{"cited_paper":"/paper/2604.17912","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d2f24033592d069f9080d019e43e0a31e547a224e406f767926a003a55ed3789","observation_id":"06732d28-280b-4403-8bbe-0417d21f2aa0","resolution":{"observed_at":"2026-08-15T15:43:00.681559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T15:43:00.030970Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.030970Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:13edb84ce36d6ccb7155374af263ae9a7805f2b54165fe682baddc25202cddb2","observation_id":"ab01f87b-de69-421e-83cf-e32cf398b70b","resolution":{"observed_at":"2026-08-15T15:43:00.030970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.035693Z","title":"Planning in markov decision processes with gap-dependent sample complexity","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.035693Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:8ca55fb2b03c69ccf66ade9f836b7c62c3078fbd87a840b5108e12cb06a1d717","observation_id":"90a5d3d3-1c0b-4473-ac97-e58517198755","resolution":{"observed_at":"2026-08-15T15:43:00.035693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00991","last_updated":"2023-08-29T09:23:24Z","snapshot_observed_at":"2026-08-17T07:52:23.588641Z","submitted_at":"2022-10-03T14:57:46Z","title":"Policy Gradient for Reinforcement Learning with General Utilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00991","snapshot_observed_at":"2026-08-15T15:43:00.040269Z","title":"Policy gradient for reinforcement learning with general utilities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.040269Z"},"links":{"cited_paper":"/paper/2210.00991","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:c28a5ca856074075016dae238f870c5b9ad4dcd9d82b99489bd98e9bbd890c14","observation_id":"22699b3b-7ddc-46f0-811d-a0fbd40a406e","resolution":{"observed_at":"2026-08-15T15:43:00.040269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T15:43:00.045102Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.045102Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:592888cb93b5092ec0f3f0c5aee355dd64bac3a28dcb0d0d58336b3c69ade48e","observation_id":"5d3e3b1d-0be1-4559-81ea-8cd12651222c","resolution":{"observed_at":"2026-08-15T15:43:00.045102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.195331Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model","venue":null,"work_id":"b4e3d6a3-1685-42a8-b1e5-5eca6b939831","year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.049986Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:3bad970d86ac957ae49dbcbd0948e834c1b1c9f1e990d731369032586fd84cdb","observation_id":"fcd66a85-f262-49b4-9429-9fe2ea430745","resolution":{"observed_at":"2026-08-15T15:43:01.200559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.054604Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.054604Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:aebffd7f33abde6e013a449390fabda27b10fbe6f55e290dc8e117b3902bc1c8","observation_id":"81685593-ebe5-4b03-9595-da5efc84ff48","resolution":{"observed_at":"2026-08-15T15:43:00.054604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.164826Z","title":"Let's verify step by step","venue":null,"work_id":"5d063022-823d-43d8-93a4-1e7f9fb7ed6f","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.059527Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:ee80fcb87f026634de34c65308a32107fb6d7e3043a1a4117fa1bed145c2111f","observation_id":"91a9539b-b2f6-4ff7-a710-2cd01fbf50ff","resolution":{"observed_at":"2026-08-15T15:43:01.170258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.147456Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"3cdc5ecb-1b64-42b6-b82b-cb5d8dc33f37","year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.064216Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:5c9d4e61e0f308c69742d1f1b61a915a2411743d24bb1d7abdb1fbedc5e9c4e9","observation_id":"aeb5fe5c-079c-4c8b-92b6-50f6800bb1dc","resolution":{"observed_at":"2026-08-15T15:43:01.152773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.131495Z","title":"Challenging common assumptions in convex reinforcement learning","venue":null,"work_id":"9b6efb64-7ec7-44cb-b683-a2882f777d6b","year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.068710Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:b7f99072e95a676a1d6a2bb35d642a9b9b2713682bb47fcca88dd7ff6fa245d5","observation_id":"2ebbdfa3-1951-496a-8bc0-acc6d8412474","resolution":{"observed_at":"2026-08-15T15:43:01.136470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.115260Z","title":"Convex reinforcement learning in finite trials","venue":null,"work_id":"c7ae02c1-d348-46ea-af60-62ad6a29bf49","year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.073411Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:bdb1827bbb911cd5fa3396b13d59fa1605c428792dbd4d234286552ca2a5387a","observation_id":"8adae96a-6142-4b32-9a7b-1b874e16fdcb","resolution":{"observed_at":"2026-08-15T15:43:01.120510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.098346Z","title":"No regret bound for extreme bandits","venue":null,"work_id":"f1e9ee53-90d4-4294-8cb9-4e3aea78b477","year":2016},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.078160Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:8b3bcbc02837a26c668f155b6fda6a40d52c4b823c682e089bf2cb7650d79274","observation_id":"be78362e-7f03-4f6c-b83f-723801e46e75","resolution":{"observed_at":"2026-08-15T15:43:01.103499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.082947Z","title":"Markov decision processes","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.082947Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:6657b24f8342451ed06c4e0492d0622dae41fd019d767da1aa812fd23d317cdc","observation_id":"44e5bb33-067d-47de-b63c-0a47e274b126","resolution":{"observed_at":"2026-08-15T15:43:00.082947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.072186Z","title":"Near-minimax-optimal distributional reinforcement learning with a generative model","venue":null,"work_id":"55cea24e-6ad5-490e-99fe-686d5d489673","year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.087694Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:f5a582c9b0c4d4d4c8a5fd80a29654ec2487a1b939af5a27cb99aace655529f6","observation_id":"e77ccf59-7b37-4a5f-a864-b189e2736d86","resolution":{"observed_at":"2026-08-15T15:43:01.077284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.092288Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.092288Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:9f2ce1f262d7b12db59f41a5604548a279f7f872f60007c05cdd89258865d3e7","observation_id":"16e479be-4ba3-421e-9332-4a85203e27d8","resolution":{"observed_at":"2026-08-15T15:43:00.092288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01492","last_updated":"2019-06-05T20:49:17Z","snapshot_observed_at":"2026-08-15T18:24:12.153904Z","submitted_at":"2018-06-05T04:34:54Z","title":"Near-Optimal Time and Sample Complexities for Solving Discounted Markov Decision Process with a Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01492","snapshot_observed_at":"2026-08-15T15:43:00.097139Z","title":"Yang, and Yinyu Ye","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.097139Z"},"links":{"cited_paper":"/paper/1806.01492","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:ef65baccc79678819518139e797953092d773e6f596ff62381be5a1687595965","observation_id":"cdf2dc89-efc2-4602-84db-0e7dfcdc4a67","resolution":{"observed_at":"2026-08-15T15:43:00.097139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.045301Z","title":"Scaling llm test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":"14f6f500-6cbd-43b4-b3ac-ddddb8991257","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.102134Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:53a3ac4d7a635ca420f97a00f7e139e8a62854a3e49570a089cd0c8f789b2e7c","observation_id":"194ae738-564d-4436-b827-29d982c6e385","resolution":{"observed_at":"2026-08-15T15:43:01.050398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":"2606.06080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-08-15T15:43:00.589046Z","title":"On Advantage Estimates for Max@K Policy Gradients","venue":"cs.LG","work_id":"2f12fbb6-221e-4fcb-a45b-b1a299519772","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.107012Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:b47d4daa550107fa1ca84f1e69c2580e8b6c9e17415d77be63c9efbe9c0664dc","observation_id":"ce10b7e7-ec70-4dd4-b0da-719367611f40","resolution":{"observed_at":"2026-08-15T15:43:00.594510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.029540Z","title":"Optimizing language models for inference time objectives using reinforcement learning","venue":null,"work_id":"db0ec9a7-322d-479f-b2af-449c1f120899","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.111838Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:bfdb52c8d4466ec30c707aef945d520adc7275d062d3ecd99f53c06932967b4f","observation_id":"29b53253-1846-4525-9ed1-32863b156d96","resolution":{"observed_at":"2026-08-15T15:43:01.034770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20854","snapshot_observed_at":"2026-08-15T15:43:00.116220Z","title":"Finite-time regret analysis of retry-aware bandits","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.116220Z"},"links":{"cited_paper":"/paper/2605.20854","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:d3d0546e9b54aef587f1a07962fdb985e37a3b5be51f4583125322253a8b189e","observation_id":"6c52c959-462b-42b7-8118-b8ff9fddab3f","resolution":{"observed_at":"2026-08-15T15:43:00.116220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"cited_work":{"arxiv_id":"2512.14617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14617","snapshot_observed_at":"2026-08-15T15:43:00.548193Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","venue":"cs.LG","work_id":"e8a68655-a7f1-4810-9ce6-2841326d80f2","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.121084Z"},"links":{"cited_paper":"/paper/2512.14617","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:951ac4ea6524c0a93eeb56c9463f0987c46bc325ad3e58bbf1cad3bf0c01c6f6","observation_id":"a3287bdd-5ede-4ab7-bf89-b864090bc05b","resolution":{"observed_at":"2026-08-15T15:43:00.554958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22763","last_updated":"2026-06-08T12:23:48Z","snapshot_observed_at":"2026-08-16T19:34:57.437958Z","submitted_at":"2026-05-21T17:24:57Z","title":"Advancing Mathematics Research with AI-Driven Formal Proof Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22763","snapshot_observed_at":"2026-08-15T15:43:00.125774Z","title":"Advancing mathematics research with ai-driven formal proof search","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.125774Z"},"links":{"cited_paper":"/paper/2605.22763","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:7df86efca43f37b5239229580ed07be408a57fd5a9558b249b3d886e6524feae","observation_id":"f57f8433-a6f2-46bc-b670-d55b6d5b0f6f","resolution":{"observed_at":"2026-08-15T15:43:00.125774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.130531Z","title":"Recursive self-aggregation unlocks deep thinking in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.130531Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:0f275c78365aafc5da7cbbd00e48485e100951db148aae3cb3f4176b0fb47005","observation_id":"a5459578-ee59-4c28-bdca-e4a58431d1c1","resolution":{"observed_at":"2026-08-15T15:43:00.130531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:01.013837Z","title":"Pass@ k policy optimization: Solving harder reinforcement learning problems","venue":null,"work_id":"b4e64309-bd8e-4ced-96d2-a649187ccc75","year":2026},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.135225Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:ed2d778495ada8fdd0a422f455dd571b975bcf0651fba73277a045e1d1e2b264","observation_id":"2d1235b0-03ef-4dcb-9484-78253068f15f","resolution":{"observed_at":"2026-08-15T15:43:01.018740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.996979Z","title":"Sample-efficient reinforcement learning for linearly-parameterized mdps with a generative model","venue":null,"work_id":"2915cb1f-e47e-40b0-867e-ac8c61e1d3ed","year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.139501Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:950ab25a22de426f4d67bc400e16288b96a1ace12837887c2df4941dfb23b710","observation_id":"1d36c955-e4b9-4b5a-8877-6cd7884a8c75","resolution":{"observed_at":"2026-08-15T15:43:01.002243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.143775Z","title":"Near-minimax-optimal risk-sensitive reinforcement learning with cvar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.143775Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:0cf3f9dd3faf05151c2d1bd6525aa1ba38720b40a95b3376c86e1e48de77e714","observation_id":"08746916-6130-4183-a306-b7442a7ecd6f","resolution":{"observed_at":"2026-08-15T15:43:00.143775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T15:43:00.148168Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.148168Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:6fde86cb61f56da161d462cbc46b6b2c2be9cb86bd78d536ff67e1c3392128d3","observation_id":"d44bf767-cedd-4e67-a821-4dd80d4ce061","resolution":{"observed_at":"2026-08-15T15:43:00.148168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13589","last_updated":"2024-12-21T04:11:08Z","snapshot_observed_at":"2026-08-16T14:41:04.718580Z","submitted_at":"2023-11-22T18:50:06Z","title":"Risk-sensitive Markov Decision Process and Learning under General Utility Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13589","snapshot_observed_at":"2026-08-15T15:43:00.152775Z","title":"Risk-sensitive markov decision process and learning under general utility functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.152775Z"},"links":{"cited_paper":"/paper/2311.13589","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:f00c718a7ff4b67f04335060a8465a5fef2180a913008aebf4de0b47780a2b44","observation_id":"0e438ab1-7139-48ec-891d-ff09a2f5fbb6","resolution":{"observed_at":"2026-08-15T15:43:00.152775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-16T13:56:19.546679Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-15T15:43:00.157724Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.157724Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:62c02a030b498a85622f990c21dbdfe228fd58260ab4842a1dcbce8f5003b71e","observation_id":"aaaaf2ff-7240-4b6f-b5d1-0bd167f1baa2","resolution":{"observed_at":"2026-08-15T15:43:00.157724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-08-16T13:50:18.721796Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-15T15:43:00.162507Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.162507Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:0cff2201fa097548a05429b9e68a7db0d8cb2e91d9a67935a743a9a34b1fb0c8","observation_id":"dedb8a22-c4de-48e0-a547-c5498c0a8718","resolution":{"observed_at":"2026-08-15T15:43:00.162507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.167272Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.167272Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:4d7793a14fb3696d80069ed02934e1dd4ee1ddd5fec98e8aad40cbecba83bd9c","observation_id":"9fe2c7f4-2c1a-4375-91a7-89e3fa68afdd","resolution":{"observed_at":"2026-08-15T15:43:00.167272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.958914Z","title":"Reward is enough for convex mdps","venue":null,"work_id":"9108e0f7-83df-423c-b14f-777cff033598","year":2021},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.171999Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:09568faf22b38466111293fd764db1487a50d5cdd0a9ac5cc31c6fe721ec8f12","observation_id":"b6238607-8f5f-46ca-8713-11438ee98bd0","resolution":{"observed_at":"2026-08-15T15:43:00.965177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.176430Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.176430Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:fdf3c98ad49601241555e873a1de3a9b5718b6630ec4c9ae4d6bbfa7f551ac81","observation_id":"70cf53ee-3fe7-443e-bb61-d43a2682383d","resolution":{"observed_at":"2026-08-15T15:43:00.176430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.180627Z","title":"Variational policy gradient method for reinforcement learning with general utilities","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.180627Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:8fbdacc27ba596795be74900148427c8019ef3abc3ec1dc843ab44566f6c0d7b","observation_id":"515c704c-2b96-4e6b-bef0-c23004832a7e","resolution":{"observed_at":"2026-08-15T15:43:00.180627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.184885Z","title":"Estimation and inference in distributional reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.184885Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:1cbe9bbe190e81a6212d223bc55dcdd186f85dede5a8bdd1df74321fa91e4055","observation_id":"c7d0718c-3cb6-4fc9-aea5-be94c0641cd8","resolution":{"observed_at":"2026-08-15T15:43:00.184885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.189171Z","title":"Beyond markovian: Reflective exploration via bayes-adaptive rl for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.189171Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:5f3abcbb1f21a4a427275c6b3b30f5b7af71a403197d99f4959ee752fd1709dd","observation_id":"9851e4c7-a1ef-4e60-8eaa-f776dfdf292e","resolution":{"observed_at":"2026-08-15T15:43:00.189171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:00.920461Z","title":"Settling the sample complexity of online reinforcement learning","venue":null,"work_id":"0916349b-9f97-42de-acc9-87d77c087816","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.193690Z"},"links":{"citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:b09051edbd9b2bae1728638fda1c71b7bf7856b5a5454b262895c4611b37af08","observation_id":"0534ec8d-deb2-4ca9-84d1-a6cf374ac558","resolution":{"observed_at":"2026-08-15T15:43:00.927032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":6,"verified_fuzzy":32},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2607.17823."}