{"as_of":"2026-08-13T22:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0ed17d62691c69275fa95ed8dcfec4fb24bd8797a13de9b106aeb3b88c21956","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:09:05.688277Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:39:40.961086Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:16:56.948632Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-08-13T03:51:31.924690Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:db035d648cee106124593499de804ea1a66e5ffff8486a14c12134fb8b1ea6a9","observation_id":"060219b5-f3e1-4f7d-bc63-23d6c1e10395","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-08-13T03:51:31.924690Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:7c52f99ad84bdd2b452c46a06f11ac20937bc33257f24a48a61ae980551b6273","observation_id":"7165350c-6e44-4731-a170-221bb6e1aab4","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2604.04855","last_updated":"2026-04-06T16:58:20Z","snapshot_observed_at":"2026-08-11T02:41:21.928926Z","submitted_at":"2026-04-06T16:58:20Z","title":"The Role of Generator Access in Autoregressive Post-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T20:16:46.370831Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2604.04855"},"observation_digest":"sha256:32cb8b2e37156a44ed8bea3c897bbb12a7ad38e5f1673ddba725449b2ca9b3b8","observation_id":"83ffcf47-4606-4df4-9e25-4bf00c095336","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-08T17:01:04.571087Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:6fddeeb13911048ba7b0c532a0b5906e72663ab749a091cf724e571b61738fa2","observation_id":"0a6e9232-a3b5-4a36-8e5d-239df60335a2","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:2e0bd5b230ea688db82623d83a60ea4407589541da1604e723198475fa084ede","observation_id":"dfdd086b-4452-41ad-96de-66c7666fd2de","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2605.11361","last_updated":"2026-05-12T00:25:57Z","snapshot_observed_at":"2026-08-13T10:40:07.505202Z","submitted_at":"2026-05-12T00:25:57Z","title":"The tractability landscape of diffusion alignment: regularization, rewards, and computational primitives","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T02:49:53.547490Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2605.11361"},"observation_digest":"sha256:fd16e793ad53020d4400d3d5c42fef841b028167e2985af06a3cf635e7af7ac8","observation_id":"3f1deeeb-f615-4c04-ab0f-469b491d570d","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:928e989b7a66a78b542ebe7aa77a99da16a27304e7144a820c30262895cb62c5","observation_id":"a4c882a5-141e-4c30-8a1d-7f1111eae931","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-13T00:39:41.357427Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:035e2e32f5c0e9e2cdf9ad9df2276a532151c0a28941a94b9cf32b5ab6eb54b6","observation_id":"c6196c4d-4b05-4577-9504-dfebd55d8b57","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-08-01T23:43:07.011210Z","title":"2510.11686 , archiveprefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15277","last_updated":"2026-07-16T17:59:31Z","snapshot_observed_at":"2026-08-13T02:49:08.522823Z","submitted_at":"2026-07-16T17:59:31Z","title":"Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T23:43:07.011210Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2607.15277"},"observation_digest":"sha256:552046f56854cc0ccb8762c85bc948f0f9b98e2562531ea1a158f98d20bc4fc8","observation_id":"8554cc91-1b8d-49f8-8889-5cdc59e11cf5","resolution":{"observed_at":"2026-08-01T23:43:07.011210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-08-12T00:39:40.961086Z","title":"arXiv preprint arXiv:2510.11686 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08010","last_updated":"2026-08-08T08:41:33Z","snapshot_observed_at":"2026-08-13T21:21:35.004739Z","submitted_at":"2026-08-08T08:41:33Z","title":"Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-08-12T00:39:40.961086Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2608.08010"},"observation_digest":"sha256:f77695709ae6c1e6450f47bb253ef47c5f5ed39740b861c329b372df986a6db4","observation_id":"58cd48d0-5f05-41ba-bab0-696d9cec0d80","resolution":{"observed_at":"2026-08-12T00:39:40.961086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.11686/citation-record","integrity":"/paper/2510.11686/integrity","json":"/paper/2510.11686/citation-record.json","paper":"/paper/2510.11686"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:05.406788Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:05.406788Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:694f1850b0733da9ba79b00e8527eaf938020950dad1d27f0cb84e7772ae97c9","observation_id":"b79db884-03c4-410c-a06e-c586ff7d0c59","resolution":{"observed_at":"2026-08-04T10:09:05.406788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T10:09:01.109898Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.109898Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:7c78c1baea10d8d6ecf8bc4d5cee37b0bd47c54a3ebc13486f1377b102f150ab","observation_id":"f85980d2-63eb-46cc-87e6-4a9ca443aefc","resolution":{"observed_at":"2026-08-04T10:09:01.109898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-13T21:20:07.492183Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12735","snapshot_observed_at":"2026-08-04T10:09:01.222940Z","title":"Online preference alignment for language models via count-based exploration.arXiv preprint arXiv:2501.12735,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.222940Z"},"links":{"cited_paper":"/paper/2501.12735","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:dabd117958f49ea48567285c0ad2487a678f4cc0249ca7bbd9c93a03f5885aea","observation_id":"b02aeed5-5e6d-4ec3-a9fd-2532a5403d52","resolution":{"observed_at":"2026-08-04T10:09:01.222940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19792","last_updated":"2025-08-21T16:32:06Z","snapshot_observed_at":"2026-08-13T08:31:09.513842Z","submitted_at":"2024-12-27T18:45:36Z","title":"InfAlign: Inference-aware language model alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19792","snapshot_observed_at":"2026-08-04T10:09:01.325432Z","title":"Infalign: Inference-aware language model alignment.arXiv preprint arXiv:2412.19792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.325432Z"},"links":{"cited_paper":"/paper/2412.19792","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:fbde9e6adb8ff926dc7c96da245a8266b92dab230497b39607e4dbae39587d06","observation_id":"463e9e3b-2338-4e17-98df-71867a3154c2","resolution":{"observed_at":"2026-08-04T10:09:01.325432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:05.543958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:05.543958Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:39f190e25c34b5698fe758ee425cd54b5aeb6637d250e9666a1fd06414914769","observation_id":"4e65d4f4-0fa9-4cf3-969d-4b8fad1fc30a","resolution":{"observed_at":"2026-08-04T10:09:05.543958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04070","last_updated":"2025-03-13T13:37:57Z","snapshot_observed_at":"2026-08-12T22:30:13.570530Z","submitted_at":"2024-10-05T08:00:55Z","title":"PAD: Personalized Alignment of LLMs at Decoding-Time","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04070","snapshot_observed_at":"2026-08-04T10:09:01.528178Z","title":"Pad: Personalized alignment at decoding-time.arXiv:2410.04070,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.528178Z"},"links":{"cited_paper":"/paper/2410.04070","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:f89e2006a035be408d35ea05b28768d77742e40c4b2042945b9caea7c652780f","observation_id":"926cde3f-18cb-45a0-b833-92284fb1fcdb","resolution":{"observed_at":"2026-08-04T10:09:01.528178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:01.586954Z","title":"Enhancing diversity in large language models via determinantal point processes.arXiv preprint arXiv:2509.04784, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.586954Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:a4aba91fe0c46e9979285ee36f49753f5bda9cc266f3240d090b6f07da8cbc7f","observation_id":"4fa1d1e6-d42d-4e58-8ba4-68cd89d5d387","resolution":{"observed_at":"2026-08-04T10:09:01.586954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:01.701918Z","title":"Uniform sampling for matrix approximation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.701918Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:780c7cc756c58e3797ccc5abc3fad23a9ca6f1fb63f334d61e9acebdef376fca","observation_id":"232a33d4-98a9-4513-b3f7-66e92f757705","resolution":{"observed_at":"2026-08-04T10:09:01.701918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:01.753216Z","title":"Weight ensembling improves reasoning in language models.arXiv:2504.10478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.753216Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:f70c31937f59578ec217da142519bc85e5f40212dba6927655f6fdd222f2536b","observation_id":"8ce1eab0-aff1-43ad-9c2c-3bb3c6e43ded","resolution":{"observed_at":"2026-08-04T10:09:01.753216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-04T10:09:01.866606Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.866606Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:1f22b3a777cf05feefe2514ae1407d7f2f18d1cd5209bff88037dc0460c542d5","observation_id":"cb676e2d-2c07-4cb0-ad95-199e248ce63b","resolution":{"observed_at":"2026-08-04T10:09:01.866606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:01.936913Z","title":"Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.936913Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:50a4950ff5077c1183c587edbea8f68760d08b29fc6c7b946ce6f710d8410065","observation_id":"f146bee1-87d4-47a7-bdbf-e45a658605f7","resolution":{"observed_at":"2026-08-04T10:09:01.936913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01807","last_updated":"2025-06-19T04:19:15Z","snapshot_observed_at":"2026-08-08T01:22:30.771699Z","submitted_at":"2025-03-03T18:37:26Z","title":"Large-Scale Data Selection for Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01807","snapshot_observed_at":"2026-08-04T10:09:02.113206Z","title":"Large-scale data selection for instruction tuning.arXiv preprint arXiv:2503.01807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.113206Z"},"links":{"cited_paper":"/paper/2503.01807","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:dc2e4955e1f0765663aa25d30b4f62b2f69e94654ec06bf2391161ec08d81abd","observation_id":"97269dc6-35f8-4512-a8c4-85965883311d","resolution":{"observed_at":"2026-08-04T10:09:02.113206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-13T00:40:10.608200Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-08-04T10:09:02.446650Z","title":"Regularized best-of-n sampling to mitigate reward hacking for language model alignment.arXiv:2404.01054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.446650Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:861a759656e766b1b2a2f6981b9e13767fd0266151dc81971a5fe2b05e0bba8a","observation_id":"90838d63-31a2-46c7-8a5a-8ebd41642d03","resolution":{"observed_at":"2026-08-04T10:09:02.446650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-08-13T04:35:55.124499Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-04T10:09:02.535591Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.535591Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:46cc30409799d20532acc12b718c9b1b64d2323c3811348022b6fd32ef4fff68","observation_id":"80061e44-3d5b-4f76-975c-ae0241157149","resolution":{"observed_at":"2026-08-04T10:09:02.535591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-08-12T14:29:08.482175Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-08-04T10:09:02.661430Z","title":"Diverse preference optimization.arXiv preprint arXiv:2501.18101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.661430Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:110e2a15698023350fbc6cac71dccd3c6bfb1684f4b642fd009027f95c431424","observation_id":"196d27bc-b522-4d0f-92b2-79ce5f46be03","resolution":{"observed_at":"2026-08-04T10:09:02.661430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-13T07:24:20.597995Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-08-04T10:09:02.784967Z","title":"Tianjian Li, Yiming Zhang, Ping Yu, Swarnadeep Saha, Daniel Khashabi, Jason Weston, Jack Lanchantin, and Tianlu Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.784967Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:2c1eea3b518c0c43c1ead55313976c0f50c3d99e0bc81eedaf91d88aa140f397","observation_id":"65341c38-834d-40f2-af35-ac56ad9d22fb","resolution":{"observed_at":"2026-08-04T10:09:02.784967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-04T10:09:02.858946Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.858946Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:fe1de409ceb2ccb387d9824857ec9ae27c109c265c47634219267864b66ef9e7","observation_id":"490f8c85-57a1-43fb-88ca-1c61f0020d16","resolution":{"observed_at":"2026-08-04T10:09:02.858946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-04T10:09:02.979065Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.979065Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:0f66e16a453170a2766941e015d3fea15dba574fcbd257cccc3f2b449dc51cdc","observation_id":"8768ed37-c50e-4366-b06c-99eaf0815fb1","resolution":{"observed_at":"2026-08-04T10:09:02.979065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02992","last_updated":"2024-05-24T08:39:07Z","snapshot_observed_at":"2026-08-13T04:26:47.711143Z","submitted_at":"2024-02-05T13:31:28Z","title":"Decoding-time Realignment of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02992","snapshot_observed_at":"2026-08-04T10:09:03.075477Z","title":"Decoding-time realignment of language models.arXiv:2402.02992, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.075477Z"},"links":{"cited_paper":"/paper/2402.02992","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:1e4f735b8ff5cf1d8f9c0017740123f14e85f107edb3527eceb649e733fa05c4","observation_id":"136895b3-952e-41b6-8241-e64f54cc20fb","resolution":{"observed_at":"2026-08-04T10:09:03.075477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:09:03.215735Z","title":"Proximal policy optimization algorithms.arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.215735Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:12e11ce4e8279f709e00aa726b2e1b07745494cbd374564cfe6ea672c55c1dfb","observation_id":"aeada442-4a94-4af3-ab47-4efc1031ee6a","resolution":{"observed_at":"2026-08-04T10:09:03.215735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-04T10:09:03.509893Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms.arXiv preprint arXiv:2506.09026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.509893Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:089ae512556a3baf213d5fac53c14d05c3971dbb15b071d327972663c7a75981","observation_id":"6a1e0385-5950-46db-a390-5826abdc1213","resolution":{"observed_at":"2026-08-04T10:09:03.509893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:09:03.708863Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.708863Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:8b19bf4abd9774c0f1629359e5476fdaaaeef749c5d9b95fc3c76ed56c34e156","observation_id":"0f4bd61a-8b01-435a-a2d8-3e36ab7d83bc","resolution":{"observed_at":"2026-08-04T10:09:03.708863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T10:09:03.780031Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.780031Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:f98258fef18f08a10acdf6728cdd7538e8f1774aff0310cce74be09f6b256681","observation_id":"d08d0480-1de6-469f-b032-079c34fa1c10","resolution":{"observed_at":"2026-08-04T10:09:03.780031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18853","last_updated":"2024-10-28T03:23:14Z","snapshot_observed_at":"2026-08-12T23:34:01.004751Z","submitted_at":"2024-06-27T02:46:30Z","title":"Decoding-Time Language Model Alignment with Multiple Objectives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18853","snapshot_observed_at":"2026-08-04T10:09:03.873616Z","title":"Decoding- time language model alignment with multiple objectives.arXiv:2406.18853, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.873616Z"},"links":{"cited_paper":"/paper/2406.18853","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:45bc43901924e139fd8dc38df2a19559dcaf88d58a7870adebf3bbc2c1441151","observation_id":"a313990a-e2cf-4fe1-8386-e1d359a077c2","resolution":{"observed_at":"2026-08-04T10:09:03.873616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:03.992324Z","title":"The invisible leash: Why rlvr may not escape its origin.arXiv preprint arXiv:2507.14843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.992324Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:424dace3250638ac0d94bbd50e94dbf661add6b0a8bea34aa853631427e91b70","observation_id":"504fac42-bdc4-4eb3-97e4-d44016c45cf7","resolution":{"observed_at":"2026-08-04T10:09:03.992324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-08-12T23:52:56.673075Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-04T10:09:04.061180Z","title":"Exploratory preference optimization: Harnessing implicit Q*-approximation for sample-efficient RLHF.arXiv:2405.21046,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.061180Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:1c99e4c7390df566369f12e95ae73f2eed597f58ede3de2a6de5032af0343880","observation_id":"ee320082-c0ca-4daf-9bb1-c229ce6aa84f","resolution":{"observed_at":"2026-08-04T10:09:04.061180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10341","last_updated":"2026-06-06T22:57:41Z","snapshot_observed_at":"2026-08-09T00:47:01.008665Z","submitted_at":"2025-06-12T04:35:02Z","title":"Formalizing Learning from Language Feedback with Provable Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10341","snapshot_observed_at":"2026-08-04T10:09:04.124049Z","title":"Provably learning from language feedback.arXiv preprint arXiv:2506.10341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.124049Z"},"links":{"cited_paper":"/paper/2506.10341","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:35abaeffac65b115d90eef26b6067a41865869dc17a9db8927a64f913b31503d","observation_id":"9ec0e46e-639f-4459-a353-d9fc20ce615e","resolution":{"observed_at":"2026-08-04T10:09:04.124049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13755","last_updated":"2026-04-12T13:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-19T11:51:40Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13755","snapshot_observed_at":"2026-08-04T10:09:04.221022Z","title":"Depth-breadth synergy in rlvr: Unlocking llm reasoning gains with adaptive exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.221022Z"},"links":{"cited_paper":"/paper/2508.13755","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:820e379d60cecaf5d08ba28bb1a60a1d68742ea8ef4ee5089e1c4e53fa0e9e4b","observation_id":"bb2b05b5-f625-4fd5-bee9-2c5abec4ff16","resolution":{"observed_at":"2026-08-04T10:09:04.221022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T10:09:04.354294Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.354294Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:3ed68a42f8a213c68b2612b5bea0218e6cde70649454d2521dbd782ab0c5959a","observation_id":"671555f6-4b85-40d5-8ae0-234b84091bd5","resolution":{"observed_at":"2026-08-04T10:09:04.354294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-04T10:09:04.463137Z","title":"Does rein- forcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.463137Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:ac57767b05fe009ea3a04dcd3781be66c3f577f6ec50b975aa271ddb8e8a724f","observation_id":"6d97fbf4-922a-42c9-976d-88763ceff4fa","resolution":{"observed_at":"2026-08-04T10:09:04.463137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:04.603388Z","title":"Expo: Unlocking hard reasoning with self-explanation- guided reinforcement learning.arXiv preprint arXiv:2507.02834,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.603388Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:fcee91f9446190d1470bf2f2944e56dc17f2c89a38e2c6ed3b23af3148512bd5","observation_id":"f00e0298-0149-4177-88b1-90d28a37585b","resolution":{"observed_at":"2026-08-04T10:09:04.603388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:04.694700Z","title":"Most closely related to our work, Setlur et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.694700Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:d31dfeef8b15833458501c0375191e0ac4e472f112957eb06b3194811950ffd4","observation_id":"5d292a63-4aa6-40c5-80df-e91d9fc64065","resolution":{"observed_at":"2026-08-04T10:09:04.694700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:04.846966Z","title":"breadth\" (batch size) and “depth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.846966Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:1cd484a7a758be4b2a835cc034eef585d2708d5fe9045435bc80dd20b3080c94","observation_id":"265fcef4-fa43-420c-ad84-10b4275e9c7c","resolution":{"observed_at":"2026-08-04T10:09:04.846966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:05.091913Z","title":"Since the dataset does not come with any train or test splits, we use the full set of questions for our experiments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:05.091913Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:2ef588bc59eaeb37f684a9c33633ab78f1634a468499903b7b043dc83ae96a5b","observation_id":"1fce4406-4920-4fe3-bdc2-5af4915478fc","resolution":{"observed_at":"2026-08-04T10:09:05.091913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:05.184426Z","title":"1− n−c k n k # = 1 |D| |D|X i=1","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:05.184426Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:fd9d36dc2b927684c6f1a80be153268cfa50e505be7181cbbea55f0ab2e6501f","observation_id":"db3ece86-d22c-42a7-b5f9-ed972f630f41","resolution":{"observed_at":"2026-08-04T10:09:05.184426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:05.306218Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:05.306218Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:2f2ab1a91fdcbb1b1e71b502ee1c4633a30d8605116dc28198c987cb1fc8abbc","observation_id":"4d833705-21d9-4738-a7c2-5b930c08a1ac","resolution":{"observed_at":"2026-08-04T10:09:05.306218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:05.688277Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:05.688277Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:97676b10acabc792d16d23598a5134b4688c3ffacafc4b72a97c2530e8ba89fe","observation_id":"739a1e3e-cd08-40e0-9283-e7ea6a0f8a89","resolution":{"observed_at":"2026-08-04T10:09:05.688277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:04.980774Z","title":"5See also Arumugam and Griffiths (2025), which uses a pre-trained model to simulate posterior sampling in-context for multi-turn sequential decision making tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:04.980774Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:27ac04bfaa2101d6383898b385b7dadd80ea5fd6761dffc5ab4eb64ac8f1f1a8","observation_id":"7810da19-7d76-4ce5-99b0-80de902e2f49","resolution":{"observed_at":"2026-08-04T10:09:04.980774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-08-07T15:20:22.627728Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-08-04T10:09:03.938953Z","title":"Pass@ k policy optimization: Solving harder reinforcement learning problems.arXiv preprint arXiv:2505.15201,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.938953Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:842505d2b5daca133f1ae5b7d88f0f76d19d6114b2952a75aad9f8a1a5a0c82f","observation_id":"9c4b6958-efad-43b3-a733-470f9bcc0a3c","resolution":{"observed_at":"2026-08-04T10:09:03.938953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T10:09:01.816289Z","title":"The llama 3 herd of models.arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.816289Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:b50bf0a129d2b899624df1faa07bbbe197e26abba2537314e563f6350a43e4f7","observation_id":"7093e53f-8790-4494-adc5-f70b9f0c8b2f","resolution":{"observed_at":"2026-08-04T10:09:01.816289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T10:09:01.638862Z","title":"Training verifiers to solve math word problems.arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.638862Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:318d30fe0107424efef3634357d283c8fad2cd8106f6425192f8640bf83f2b5b","observation_id":"69fd3b8d-2aa5-4606-b93a-117f4365fd7e","resolution":{"observed_at":"2026-08-04T10:09:01.638862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-13T17:28:56.101002Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-04T10:09:00.796356Z","title":"Phi-4 technical report.arXiv preprint arXiv:2412.08905, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:00.796356Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:f991dcf6fb2c63bbc35131948a712d6743c3d676572c1cd1946fb9f7e24c7872","observation_id":"0eb5adf9-106e-4306-9550-230e97de115d","resolution":{"observed_at":"2026-08-04T10:09:00.796356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-13T07:28:13.001627Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02355","snapshot_observed_at":"2026-08-04T10:09:02.013031Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening.arXiv preprint arXiv:2506.02355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.013031Z"},"links":{"cited_paper":"/paper/2506.02355","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:7e91c5d15ee01413e9600de9d0c957e7c6bef4fbc9cf07885db44fddd39a5ad9","observation_id":"0f0c4e45-d421-4efe-ba34-a2461a8ed359","resolution":{"observed_at":"2026-08-04T10:09:02.013031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T10:09:01.459764Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.459764Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:d1da6d1932e5c8358ec5861e02c8073235ce26c0f924aa38eac11c91783d57ce","observation_id":"8162654f-9f9b-44bc-8130-bdfa01ddf0bb","resolution":{"observed_at":"2026-08-04T10:09:01.459764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-04T10:09:03.372158Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning.arXiv preprint arXiv:2410.08146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.372158Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:a550aa2811bb59159512f791584501e443bd229c3d9820847f41c0c8c4866403","observation_id":"e8c1a04d-130e-402d-a097-0545c2cb0b30","resolution":{"observed_at":"2026-08-04T10:09:03.372158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:09:00.918533Z","title":"Toward efficient exploration by large language model agents.arXiv preprint arXiv:2504.20997,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:00.918533Z"},"links":{"citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:54c815a8dce713d4b8b4b5e59d437437a0976e42f623187e72aa3e8397a17164","observation_id":"715b425a-62a1-453e-ba41-0ef7d61e0ce5","resolution":{"observed_at":"2026-08-04T10:09:00.918533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-04T10:09:02.327154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.327154Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:5cc096e43aa456e7969ba839777d48527c3217bb8e0dfd5a7a9e65a70724c9e0","observation_id":"23ca3af1-8764-442a-9128-d844f7ebc685","resolution":{"observed_at":"2026-08-04T10:09:02.327154Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-13T05:40:28.055216Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-04T10:09:01.404089Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.404089Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:f30198f42b24e063e8db4671a77bf075d1263c22c43fa5e785ee794e70148fa8","observation_id":"01876772-9818-43a0-bc5d-1d36c572f2cd","resolution":{"observed_at":"2026-08-04T10:09:01.404089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11202","last_updated":"2022-04-11T19:34:30Z","snapshot_observed_at":"2026-07-06T12:00:17.963060Z","submitted_at":"2021-10-21T15:25:15Z","title":"Anti-Concentrated Confidence Bonuses for Scalable Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11202","snapshot_observed_at":"2026-08-04T10:09:01.013036Z","title":"Anti-concentrated confidence bonuses for scalable exploration.arXiv preprint arXiv:2110.11202,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:01.013036Z"},"links":{"cited_paper":"/paper/2110.11202","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:51adb302da131c6167fbef3056c6527737298a779964719e934f30912e7eedfc","observation_id":"a8299430-4a49-47a9-a262-4b91bc6e1875","resolution":{"observed_at":"2026-08-04T10:09:01.013036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 10 inbound Pith citation observations for arXiv:2510.11686."}