{"as_of":"2026-08-22T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5da63ae32e78f8724fcc95e07643cbe655ee71613b8bb0f9c801dbc6c032759","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T06:44:16.198117Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11146/citation-record","integrity":"/paper/2607.11146/integrity","json":"/paper/2607.11146/citation-record.json","paper":"/paper/2607.11146"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Conditional","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:e40da8e9cda9843f488d944dbaa87b6a87439ab4af367dd82c9f65c1f53d08ce","observation_id":"baa8acb5-a215-4027-83be-d899059ce121","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Biometrika , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:b8407896427ec37913cfd46c0ecc629b7fad636574d24f77e50d9069e45c1f35","observation_id":"615929d5-0cec-4980-b0c5-230176cc0969","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Computationally Efficient Optimization of","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:36dabfceaef760d7a373418b1ba492d7afb025a436fd6529b9874f4133e91a2a","observation_id":"347bc1f7-fd9d-40d1-a060-253ffa5acd19","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9d474e6413f5bde746b943966ad807e6e15d29ebb0c3cfd4a3be62bc18588407","observation_id":"22323db2-077d-4ce6-9ef7-86ded7b52560","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01174","last_updated":"2025-08-02T03:25:26Z","snapshot_observed_at":"2026-08-18T04:01:56.140125Z","submitted_at":"2025-08-02T03:25:26Z","title":"RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01174","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2508.01174 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2508.01174","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:c1c859c91d19e12b2da171ddbbeeb5586f6bf98425921ae9475a88dc877a1c90","observation_id":"bc930beb-58cd-4ecc-a2ad-d273e66721c7","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2606.06080 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:c50687a1f0516465c8a94c56ee159f86a788dfb02f062c1237ffe61211bbf422","observation_id":"2ab39a61-7fdc-44b9-ba0c-266f239da232","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-15T12:40:23.969856Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06096","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2606.06096 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2606.06096","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:df91353ec9498df3d142c45170afd1ca4f20857736afd0899e37d34a5c8ef6c7","observation_id":"6896b378-7fed-44bd-b6f8-dcd0c1a30cb5","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2510.23393 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:a31fcd2c76ab6f6e40bdc924db7d074c54025275d162cea61c8826887017f180","observation_id":"fea2c899-10fb-4f4f-987e-1789dea19f42","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:d96ed47b7874bca39b8f226b56d2c7b2a9893aeeeefa8093c513e2396599e10f","observation_id":"4926244d-f3bf-448b-888a-a6ff2245df2d","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.06059","last_updated":"2019-05-29T20:05:01Z","snapshot_observed_at":"2026-08-14T17:02:16.162795Z","submitted_at":"2019-03-14T14:56:06Z","title":"Stochastic Beams and Where to Find Them: The Gumbel-Top-k Trick for Sampling Sequences Without Replacement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.06059","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Stochastic Beams and Where to Find Them: The","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/1903.06059","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:f709eca74c1dfc4b830d097e1caa827ca59994def37fab669f36af79993fda8d","observation_id":"4f40a9d8-198f-493b-96a4-50da57642f0b","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06043","last_updated":"2020-02-14T14:15:18Z","snapshot_observed_at":"2026-08-09T06:15:50.473902Z","submitted_at":"2020-02-14T14:15:18Z","title":"Estimating Gradients for Discrete Random Variables by Sampling without Replacement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06043","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"8th International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2002.06043","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:8605b3c027f1d231e2046f7b985b355a4f88142c0fc2241716a3d4eb16ffaa56","observation_id":"74e6cbc5-a7c8-450d-9a91-24ad0b51d97f","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Proceedings of the 37th International Conference on Machine Learning (ICML) , series =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9024912eae31df3ed6097ada1767e588ce772ab28d8a264508b16de0b0800845","observation_id":"bb9d5e15-71c5-4c0b-9b1e-b6ef94755c76","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Journal of the ACM , volume =","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:bf63f87da4de1b967e398e3b1c511dff39554b6b81f27bb2ce42c0c1b097afcb","observation_id":"c24b8b12-0b06-4fdf-ba77-b47aba57c30f","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10036","last_updated":"2019-11-22T13:34:50Z","snapshot_observed_at":"2026-08-18T18:34:41.811137Z","submitted_at":"2019-11-22T13:34:50Z","title":"Low-variance Black-box Gradient Estimates for the Plackett-Luce Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.10036","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":", booktitle =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/1911.10036","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:b42e863f406b64ef9f43f69054cfcb556222e92b0b402e04830be1082f3544b1","observation_id":"751bc6f9-8ea0-4376-b35c-6bc4c0942fd6","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2014 , month = aug, howpublished =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:99982ac556e18c6ccdb217332b4ca868580a40bed41aff9fcec6dba6480a1b20","observation_id":"325de8de-2e52-4b9c-abf9-9a3624a3ff3c","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Proceedings of the VLDB Endowment , volume =","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:b53f7a157eda31011ce5a9576e3b904e8f941ed51e2f509e905fd371552c7865","observation_id":"f1c2dc73-0a4c-4104-944a-eccb2a56623b","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:cf199913651343b8bd25076a05ff6edbbb1d13dde27719f1e1a5b165fd37df8d","observation_id":"e3216397-0154-41b9-a68d-905aafb5e0fc","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2020 , eprint =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9c909afd2e62bf324d8bf807a322131c406de8c6ef5cdcada107d4ce0cb5f9ba","observation_id":"f010eeb7-dd70-4669-9e95-f14988eb2539","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08475","last_updated":"2019-02-07T09:10:08Z","snapshot_observed_at":"2026-08-16T10:05:54.113196Z","submitted_at":"2018-03-22T17:22:24Z","title":"Attention, Learn to Solve Routing Problems!","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08475","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/1803.08475","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:357d2ef72d7ba549edf3ad859ac5ed111f650888da9fe837557cb227b951ace6","observation_id":"4215de35-f441-4ed2-8d42-8e20605e5b12","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Winner Takes It All: Training Performant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:99ea9926227157d4ae11a25dbc9dd4d7ad03ee497d31599f19bd06ea2cfb6707","observation_id":"38d26e2e-88be-4d4e-972f-941eae9c3d10","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:2d86f27cecace966faea8187f65720c3ccbc8f7797251c41cb048b51c190b625","observation_id":"cbd7bfd0-9838-421f-ba8b-0d64e8087f64","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15180","last_updated":"2024-06-11T19:48:33Z","snapshot_observed_at":"2026-08-19T11:44:48.978116Z","submitted_at":"2024-03-22T13:09:10Z","title":"Self-Improvement for Neural Combinatorial Optimization: Sample without Replacement, but Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15180","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Transactions on Machine Learning Research (TMLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2403.15180","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:c22dd646284fd189d646c2a67a013cbef5066856daa40acf66573660cced572a","observation_id":"eddb20e4-60e2-4ea4-8eb0-f8dd57cca72b","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Leader Reward for","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9d4ead06667f774ed070ec862fac2e0d5f91b307a59bff02dc2942d384192d32","observation_id":"64de43a5-532d-467a-95d6-58201f402220","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Variational Best-of-","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:bb4ffa5415330c47dd59be8ec67d8f681717e7ffc929b5b1ecf1418b5128aaae","observation_id":"91e72a01-efcf-4148-815b-df66daacabf2","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"and Zhan, Anthony and Gandhi, Kanishk and Goodman, Noah D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:ff928da94115f6ff81e6427b5883d3230fe50e675090ec790126e8ca293b7ac1","observation_id":"f1997d5a-cba9-434c-acf6-cad735e8af65","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:68ec298a46b978025420c7cc9e43d094afbe5e36bbee8078e6e5200d21f807fe","observation_id":"1e5d896f-cad1-46dd-8516-b04d33fe04a8","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27000","last_updated":"2026-07-08T03:26:35Z","snapshot_observed_at":"2026-08-13T08:41:56.987481Z","submitted_at":"2026-05-26T13:21:11Z","title":"Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27000","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2605.27000 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2605.27000","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:116590938226fcc14a7abaa5ed8f41b9c4e5c6fdf582a53b0ea3f6553aa8c5e6","observation_id":"ed8d7280-4a59-4eba-95e4-82f389799c64","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:febb26aaac10af5be5e76c0d6c1bcd59ec48b027e32bc154ced43e2ce77b4846","observation_id":"d489190e-01e8-4063-a781-286011bccd4e","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Proceedings of the 28th International Joint Conference on Artificial Intelligence (IJCAI) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:32557c3793bd17f6016fa1c6f954eacb337db899dd4f8e8956baffa1267b1a79","observation_id":"bfab8a82-32f0-44d1-8de5-cc2e7b09b367","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:7bbe62e2bd1ac968c1789656fbf445a7feb9d10a9a25c245e61ae404bd3e75f9","observation_id":"e0b98bf1-c0bf-482a-b609-87535984d1b9","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Ahmed, Nick Duffield, Theodore L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:fef4e9d31ee724955773200443e55f4530f000046f1eb71909d5feb017030213","observation_id":"b987e703-a624-423e-8cd0-7065a9101093","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06057","last_updated":"2025-03-04T14:33:50Z","snapshot_observed_at":"2026-08-18T02:48:59.600950Z","submitted_at":"2024-07-08T15:59:44Z","title":"Variational Best-of-N Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06057","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Variational best-of- N alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2407.06057","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:c6313f6d3870527888212ebadbdfdcab5e73fc836cd565f57bfb15f2c61f39b3","observation_id":"00553ecb-2788-4879-a3e5-1eddc551446c","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:4d7d34dea128cc0c44a01bba76795ad28f72203e5e5c3829d1faf37792750f74","observation_id":"bfaddbe4-0b80-4a8a-b170-9624f5a024ac","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Dempster, and Jun S","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:a5ff6210b636507355e30e68d2769fb7540d67061c8ecac6bb66fb00eeed82eb","observation_id":"cad04217-7aec-4aa9-88d2-05fba70be87d","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3856.145388","doi":"10.14778/1453856.1453884","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tighter estimation using bottom k sketches","venue":"Proceedings of the VLDB Endowment","work_id":"1a2a6621-c713-468c-8f2f-4664ed7ad6e8","year":2008},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:1ed68f2ff0df6c3f8aedfdadb67955f98c915e48545d744ff5e9ae124e67a537","observation_id":"857d022f-729f-46ee-9073-cd75ab1e0405","resolution":{"observed_at":"2026-07-14T06:50:17.949041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:50.208071+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:50.208071+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/1.9781611973068.136","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stream sampling for variance-optimal estimation of subset sums","venue":"Proceedings of the Twentieth Annual ACM-SIAM Symposium on Discrete Algorithms","work_id":"112b0c49-07b6-4e46-95c4-4c890b42d7bf","year":2009},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9d79823ebd1175a6b9bbb437bebaeae2bdea6eba437e2b3ec256014809b1d9cf","observation_id":"77e7b3b2-bec3-4591-8025-0224d1a5a4f1","resolution":{"observed_at":"2026-07-14T06:50:17.953149Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:50.463336+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:50.463336+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Priority sampling for estimation of arbitrary subset sums","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:24952d20cc16203ed063aee0b4c03911e4172fc8d7c15f126791abcb3d056b3c","observation_id":"f45ad821-790b-44b8-9ec9-aedc598ba4f3","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i06.6572","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"4d8eabe6-4e06-4b25-a2de-f60660764e96","year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:6dc56a502d0550945341bc6111758d8a1f5467635e20f36f50cae2e61b81fa11","observation_id":"71abd97e-9964-45ce-be17-299c03f85baf","resolution":{"observed_at":"2026-07-14T06:50:17.939023Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:50.968983+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:50.968983+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:d48f74bcb2f2104800dd1efdd8add59c502f39a47730fe5693c6e3d8936a3e9f","observation_id":"b1074197-18fc-473c-9f8f-bbe7731dd6da","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"PolyNet : Learning diverse solution strategies for neural combinatorial optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:744618ef6af3f3fafb596824bd991a0a115b4f2f571f1bfd551f5665183f56f5","observation_id":"488892cf-edbd-4749-95d8-c8993c1f746c","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Stochastic beams and where to find them: The Gumbel -top- k trick for sampling sequences without replacement","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:9d12301cd00e83320ce6449b0d2a77a70e9eecec6551af7014d16f03a2db806c","observation_id":"a7034ad3-49c6-417a-ad7a-206447160bda","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Estimating gradients for discrete random variables by sampling without replacement","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:229d83d84738ba6f2da3852864a3140faef547cc237e691e780f53af70166c42","observation_id":"7c84cf47-8ca2-49ba-829a-4b9f242707f6","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"POMO : Policy optimization with multiple optima for reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:1344c0bc17d9c8d1dae198134bed4977c5d2957e99e4ea15e9bba472f96e0f73","observation_id":"f4dbe44e-20c5-4f60-802c-befc870e749b","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.01179","last_updated":"2026-07-01T17:10:08Z","snapshot_observed_at":"2026-08-16T08:03:15.231712Z","submitted_at":"2026-07-01T17:10:08Z","title":"QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.01179","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Li, Anthony Zhan, Kanishk Gandhi, Noah D","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2607.01179","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:0e56c07ee6e6453b2bbd18329e640c6439dcc8310d8f7896dbc372e1a6fc6986","observation_id":"f5e28f1b-5cf2-4ead-be7a-8a4942745b00","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning , 2026 b","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:b5fcb68b686d149a1f8ef2f97f850785b1538d0b2cb40f3e87cdbacc33b16995","observation_id":"be9a21d2-88b9-49b5-9ae7-c4f794dc53ea","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Understanding R1 -zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:3eedbbf79969f341e19576af7843fe498f6a11351b0e20a95880022451b2d71e","observation_id":"4f93ba30-c06b-492b-8503-87b20a34ffe2","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11034","last_updated":"2023-03-01T20:15:51Z","snapshot_observed_at":"2026-08-16T17:54:43.687680Z","submitted_at":"2021-09-22T20:49:16Z","title":"Conditional Poisson Stochastic Beam Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11034","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Conditional Poisson stochastic beam search","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2109.11034","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:7319661bca659b1e727c42eb395ecf408508d5b0cebacb82feba6c3fc79706d4","observation_id":"5ca17f2b-7bd8-4ba9-9d96-ed5d8e573895","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.00855","last_updated":"2021-07-07T12:44:42Z","snapshot_observed_at":"2026-08-16T18:27:25.922033Z","submitted_at":"2021-05-03T13:41:46Z","title":"Computationally Efficient Optimization of Plackett-Luce Ranking Models for Relevance and Fairness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.00855","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Computationally efficient optimization of Plackett -- Luce ranking models for relevance and fairness","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2105.00855","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:09a0241b3d403813b62fe2027ea9e01528979b4c7eed24a801ef9bd784c265b2","observation_id":"179a38a6-fce8-498a-8255-4952101ff3eb","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation , 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:b12ce0e529a971a00e059289a9d475d168540157e22fe33b1fdb72f8399faf01","observation_id":"050b13e0-8aa7-4d26-915a-a20c09cc8152","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08063","last_updated":"2021-02-28T23:43:23Z","snapshot_observed_at":"2026-07-06T09:28:59.431672Z","submitted_at":"2020-06-15T00:43:44Z","title":"Gradient Estimation with Stochastic Softmax Tricks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.08063","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Paulus, Dami Choi, Daniel Tarlow, Andreas Krause, and Chris J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2006.08063","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:cf277b0279be9ea6d7bd99ba0bea6c2a3d62ad3e8d54124298588c58410fd341","observation_id":"ac80b3c2-cee1-4eb6-a06b-a1cb1cd30373","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04871","last_updated":"2021-04-05T22:29:16Z","snapshot_observed_at":"2026-08-15T22:16:07.409239Z","submitted_at":"2019-12-10T18:25:48Z","title":"Deep symbolic regression: Recovering mathematical expressions from data via risk-seeking policy gradients","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04871","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Petersen, Mikel Landajuela, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/1912.04871","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:11248f333cd97946300898198c81d72533f05c797504b21a0dfb0275bd44e255","observation_id":"aa7ed14c-1f03-472a-863a-c91bdf54d84f","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:e677d21c1c40f9ab775c1949d1799fbc7e25c2114e0b418e3d563fb3fda5392c","observation_id":"597016dc-504d-4662-a792-9d8f12498fd3","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-08-20T11:04:16.969221Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"BOND : Aligning LLMs with best-of- N distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:3bef88766bbd878b6a845afd85c99375319875e9371bb9d618dae107a5336f53","observation_id":"4cb0ef76-f7d2-4d3b-9c00-9b632553fef5","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Incremental sampling without replacement for sequence models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:0a6b4bcf2b1c526f75cfc0711a267f0c68749cae48ccf3a328711db7918bd86d","observation_id":"e7a08a80-89f8-4a7d-aa6c-4739744aef84","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"On Advantage Estimates for Max@K Policy Gradients , 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:4e3da7b1ff0195752edd3754637568b3bc74e5fc57bdac9a65aa9482c2490cb6","observation_id":"1f5072c9-4f76-4b43-9b19-3e0f9d25a183","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:1a6ebc2123ed745338b6dba74093632109fa767933e03f7b712114946992652b","observation_id":"b9631100-bc6c-4389-9941-29ec51c6ba0e","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Gumbel-max trick and weighted reservoir sampling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:260cc9a1093870bacbc718edb59aea974d6e693311803528891e010635554e2b","observation_id":"2d443b4a-4f94-4ee6-8197-67a7ab00e800","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:45ce78604d139b55727548393b9a33bc6d1e950e59629321deadb5d997e56f32","observation_id":"b5dbf9ab-8461-4705-bdba-f4c453335749","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13947","last_updated":"2026-06-29T12:21:17Z","snapshot_observed_at":"2026-08-21T05:22:21.917225Z","submitted_at":"2024-05-22T19:27:03Z","title":"Leader Reward for POMO-Based Neural Combinatorial Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13947","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Leader reward for POMO -based neural combinatorial optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2405.13947","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:849bf4e4bccac7c625a35c9554e651329b3604e14c3adbcfce189c0395370969","observation_id":"1a5b7ef3-d656-4f84-8e2e-c5c7dc850b1c","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10517","last_updated":"2021-02-26T19:31:03Z","snapshot_observed_at":"2026-08-15T13:54:55.198162Z","submitted_at":"2019-01-29T20:09:18Z","title":"Reparameterizable Subset Sampling via Continuous Relaxations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10517","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"Reparameterizable subset sampling via continuous relaxations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/1901.10517","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:6ec7242a9e5e1994767d02a7b0e91e5592f89b1508d5267cce5233d2d5e983ba","observation_id":"07dde933-115e-4a37-86f4-9a52c578c9d3","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:f546d23d0ccb69915909feb5dc15ed235db99ed0553b96fb16a58336da6f81ad","observation_id":"891a236e-9694-453d-ae62-e3e58b303975","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T23:38:52.756466Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2607.11146."}