{"as_of":"2026-08-09T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad1c8bf77f40bbc553db4ef404ceb26411f18b4d7a3a1b24d3e6e5a52fb09e40","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:15:19.895698Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19408/citation-record","integrity":"/paper/2607.19408/integrity","json":"/paper/2607.19408/citation-record.json","paper":"/paper/2607.19408"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.155018Z","title":"Dense reward for free in reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.155018Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:33b2450d0b7938d83bcf15eb996b537fdefc2e2d7654cadcdb8fdf6b6970b79f","observation_id":"c1612773-4807-4786-bf15-1d21f04b9e95","resolution":{"observed_at":"2026-08-02T08:15:19.155018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T08:15:19.226461Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.226461Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:4fd50d1e7b21bbbb94e57ad486d1e4fb4509c519e8986692b8bd9c4ca1afe12d","observation_id":"40d49530-339c-4270-b019-946119d79488","resolution":{"observed_at":"2026-08-02T08:15:19.226461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-02T08:15:19.305019Z","title":"Process reinforcement through implicit rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.305019Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:8a7d940161108932094e74559a2aa146e32a1fb47fe1e185b00c7972cc5bf652","observation_id":"074ee4f9-2342-4368-a7fd-4c482f5cae8a","resolution":{"observed_at":"2026-08-02T08:15:19.305019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-08T01:11:30.324736Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-02T08:15:19.428563Z","title":"On designing effective rl reward at training time for llm reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.428563Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:9a459d8cae8b52496b5293298e2beb978f508553814099b984b63e49bdf9d4e6","observation_id":"6d1654b2-3948-476e-b468-3357d054e2fa","resolution":{"observed_at":"2026-08-02T08:15:19.428563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.490631Z","title":"To- ward semantics-based answer pinpointing","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.490631Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:ac82563c0fe5877e502c2a1102db665f629a90783df7d69cd3ada68c9ab8891f","observation_id":"46f5c39f-8313-4aa0-9ac9-69f2cf5d1d19","resolution":{"observed_at":"2026-08-02T08:15:19.490631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.522302Z","title":"Learning question classifiers","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.522302Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:82c5192789768fbe29ca177477de73bb5579eada6b8d5da20410fdeaee2cffb6","observation_id":"bc50babb-2fbf-4087-9e68-88def37e6412","resolution":{"observed_at":"2026-08-02T08:15:19.522302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.589635Z","title":"The blessing of dimensionality in llm fine-tuning: A variance-curvature perspective,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.589635Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:944a2d27b74aa502bde0e29184740c89effbe9d1d96a9e94f4077ec50a63db51","observation_id":"a0dd0eec-1ae5-4e4b-9bbe-33b6c4f532e3","resolution":{"observed_at":"2026-08-02T08:15:19.589635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.810036Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.810036Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:8550348a1a08a4d9871c5bf4c78c2bcc175d748dc2e160b9ce41aa7185a0dc7b","observation_id":"a608cb4e-066c-46d2-a96b-0efe913ebcc4","resolution":{"observed_at":"2026-08-02T08:15:19.810036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-02T08:15:19.844834Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.844834Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:1267453f068d4413c9ee801b6a296bdc472aac1020cf7e5b2a19a9ecc4c4225c","observation_id":"2ebc1bba-b51e-4233-a9f0-d6d44130e546","resolution":{"observed_at":"2026-08-02T08:15:19.844834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.849014Z","title":"Lee, Danqi Chen, and Sanjeev Arora","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.849014Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:d548c1746675b88bb501937b30581104011bd3341add18d0d70685ccc3898a52","observation_id":"95156e19-0ec0-4a9b-8fed-b26b49ecb5f0","resolution":{"observed_at":"2026-08-02T08:15:19.849014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.852682Z","title":"Random gradient-free minimization of convex func- tions.Foundations of Computational Mathematics, 17(2):527–566, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.852682Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:40bb676c91d2534799f130471a3dbfe8b6ab46033fc45b4dd9c2df704df9f3fe","observation_id":"3b3dc49c-f664-4945-bf09-e5979f0b8983","resolution":{"observed_at":"2026-08-02T08:15:19.852682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-02T08:15:19.856120Z","title":"Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Mey- erson, Babak Hodjat, and Risto Miikkulainen","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.856120Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:6a64227b22282d0029a03b8e71babb866777f0fef47a2ff3d1279a6b6e74f013","observation_id":"1fa9f782-49b7-4896-a4c0-e3fef6f00255","resolution":{"observed_at":"2026-08-02T08:15:19.856120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T08:15:19.860627Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.860627Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:e3e88d21d8107c5cb6d19693d4ac0da1eb6044be65ac2e51806a04a4d0bb0c18","observation_id":"a1adf360-e185-4376-8a4b-a3b016651d6b","resolution":{"observed_at":"2026-08-02T08:15:19.860627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-02T08:15:19.864221Z","title":"Evolution strategies as a scalable alternative to reinforcement learning, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.864221Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:2f33e6c3863acaef96dbce616fe533516b1d971b2b3cd40848e7d950ae5658cf","observation_id":"cf62eb38-1832-4f7b-8297-a56ac2031945","resolution":{"observed_at":"2026-08-02T08:15:19.864221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.867837Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.867837Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:f1c2579628ba2dff20177e6ad6a637cf0ec0ef8913e420969c18434884caa180","observation_id":"48289a40-839e-4a98-92ad-a85a1f47eab6","resolution":{"observed_at":"2026-08-02T08:15:19.867837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.871408Z","title":"Black-box tun- ing for language-model-as-a-service","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.871408Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:bcda8e8c64e9d235ec818f9716cfa56efb3dcce62468825f14db8dbb7fc40623","observation_id":"850ab672-14f4-424d-8163-5446b0ebc093","resolution":{"observed_at":"2026-08-02T08:15:19.871408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.874508Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.874508Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:5d65c44eaa02d6de27377ad63a00de10c2910780f5f3e16923a259eeea126ade","observation_id":"4629c3be-53c4-4be3-892d-318b66d519d9","resolution":{"observed_at":"2026-08-02T08:15:19.874508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-ac","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:18:25.805881Z","title":"TLCR: Token-level continuous reward for fine-grained reinforcement learning from human feedback","venue":null,"work_id":"53a58c10-facc-4762-bfd5-7f57c68f87dc","year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.878269Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:b1d6a73547dfcc4c931798162c2b2686ecb91f4776423f49bd7502d262746a32","observation_id":"2eb6ba90-93c3-447c-bb2f-ee3a8d42ce8d","resolution":{"observed_at":"2026-08-02T08:18:25.912187Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.881783Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.881783Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:1ee21fc308bb3ec0bc353e7818685e0d6b822602d119c57beca694fb1f4b96b3","observation_id":"0beb7bd1-65e7-4566-adbb-47e7684e278a","resolution":{"observed_at":"2026-08-02T08:15:19.881783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.885366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.885366Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:179c017058a5e3bfeb506c3cd609375bb17f1dcdfb00e616cf12c449a01434e6","observation_id":"10f428bd-cdf0-4a13-b936-84da42b94da2","resolution":{"observed_at":"2026-08-02T08:15:19.885366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.888832Z","title":"Total cost:2KB forward passes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.888832Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:23c46412b4153ea0826a84d80cfe17ca430c2640c8a8fbe4e000ac46791f60bb","observation_id":"47647dd0-8559-4301-92c2-4581983fdba1","resolution":{"observed_at":"2026-08-02T08:15:19.888832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.892116Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.892116Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:e165f59e3d7f04a01451a600fc3186214c580d2e79706738b6e72862e5289f90","observation_id":"8c6a4a03-9ce0-4561-b582-cdd0774c74d4","resolution":{"observed_at":"2026-08-02T08:15:19.892116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.895698Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.895698Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:f2a141feafb7ae5a32474fcbff245d53db650a092172017e3cd1215f63c6d8b1","observation_id":"096c7ef5-696a-43fc-b7c3-5fe9d76ac254","resolution":{"observed_at":"2026-08-02T08:15:19.895698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.670505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.670505Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:e146de634d9611271033921202ad30e0cb9c939852a07701b1ce17dc7a600c43","observation_id":"4a631a5b-30bc-42c8-bba2-f4afe7a0d02b","resolution":{"observed_at":"2026-08-02T08:15:19.670505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T02:29:48.214168Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.19408."}