{"as_of":"2026-08-04T17:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25e009127de4a424a7eb7ab8201fd93b7c618d5f28aa9923f92fde129e6db24c","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:51:00.913166Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:47:18.868835Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20051","snapshot_observed_at":"2026-07-30T18:33:28.486944Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-04T17:19:18.752276Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.486944Z"},"links":{"cited_paper":"/paper/2604.20051","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:a428f9ae2d8b09e5011891d04631d9ef2ff35ffb6f62103c484c0a5ab7b2b820","observation_id":"cbeba9fc-2602-4817-898f-741f2802f596","resolution":{"observed_at":"2026-07-30T18:33:28.486944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20051","snapshot_observed_at":"2026-08-03T01:47:18.868835Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-04T17:19:18.752276Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T01:47:18.868835Z"},"links":{"cited_paper":"/paper/2604.20051","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:fc26222391e7c63144aa0404664c6e94dbcd69821e0483d2b620902848887483","observation_id":"b4fc8f56-bfcf-4177-9ee4-d60d00d5ce5a","resolution":{"observed_at":"2026-08-03T01:47:18.868835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.20051/citation-record","integrity":"/paper/2604.20051/integrity","json":"/paper/2604.20051/citation-record.json","paper":"/paper/2604.20051"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-07-10T18:57:31.585722Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ffdfb24cce59a73141baac3e91454139583ccdf146b1a966e8e5e9b75d12de06","observation_id":"c16066c7-4b69-46b8-80e6-d3f021fd5220","resolution":{"observed_at":"2026-05-13T05:18:21.444858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-07-06T21:15:21.546083Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:151fad663da4a81799f21f32e00e9c33fe8e047cc4b637190b209b836d114061","observation_id":"b8b22f47-daa5-455e-80bb-bc43f4b79248","resolution":{"observed_at":"2026-05-11T13:21:18.201366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10642","last_updated":"2025-01-24T15:21:47Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:16:22Z","title":"Self-playing Adversarial Language Game Enhances LLM Reasoning","version":3},"cited_work":{"arxiv_id":"2404.10642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- playing Adversarial Language Game Enhances LLM Reasoning","venue":null,"work_id":"bac5d626-62ac-48f5-95e5-0ffac3ff68a8","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2404.10642","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:18f230c82d044cf99e2029b6dfdecbad30d403811d02202a91e94ce4c507997a","observation_id":"9b305eee-49a1-4e18-b7ad-5f8008fd23ad","resolution":{"observed_at":"2026-05-11T13:21:16.065828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:6a236a9048c0de9147a1058eb15cee3487340a92b2eabac619288e0d4bfe7e03","observation_id":"cad5ea11-a550-4ee0-88cf-28b1382f298d","resolution":{"observed_at":"2026-05-12T01:23:37.463337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:9f8d433b4966bcb470871427dd8f88947677ff01919625d546c0711d55920843","observation_id":"5ed87529-ca00-4062-963b-8737ce276527","resolution":{"observed_at":"2026-05-11T13:21:16.791554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:930568d20244658d6f92ea71612322654e69197c738578023ee80f748c87d13b","observation_id":"ee773845-5881-47a3-aa5b-3c7013d6cb71","resolution":{"observed_at":"2026-05-11T13:21:16.865950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qa-lign: Aligning llms through constitutionally decomposed qa","venue":null,"work_id":"e6e1f65a-c461-4a57-b991-edf0f80d3f09","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:087f4e73239c7bb280623bfa43a735c5e7c8e91c3be645c5a68342749fb0548c","observation_id":"1b4f9982-637e-4fc4-b90c-afdd0c0ea026","resolution":{"observed_at":"2026-05-23T01:52:24.332412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openwebtext corpus","venue":null,"work_id":"5c053557-ff0e-453d-adcc-e82ea9910b1f","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:362eea90dda33f84a4b90434e958d0402000c9f379cc9145f590f7f73fefe8d7","observation_id":"13ee7d65-ed37-46ce-85f8-ba1621619c42","resolution":{"observed_at":"2026-05-23T01:52:24.335087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:e82293aa58f207f5f9c92e7d8b339ca7ec30b8dc2844aef3bb8f02599ecabe38","observation_id":"4b045794-9b96-4880-9d6f-2330be434a01","resolution":{"observed_at":"2026-05-13T06:07:56.884714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lighteval: A lightweight framework for llm evaluation","venue":null,"work_id":"47a23329-17e7-4139-a395-a8d1b16a5c8d","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c5cb9fd2add8cbb4295e73ce616a3ce090c4a965ded1eabe68d5c83d611914dc","observation_id":"a50147df-d2eb-4762-bf22-a40cc296e96f","resolution":{"observed_at":"2026-05-23T01:52:24.356439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10507","doi":"10.48550/arxiv.2511.10507","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2511.10507 , year=","venue":null,"work_id":"9856b82b-89d8-4de5-95b0-b178d14f782f","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:0487e0118a86e162460105f63ff8bcf9768d00e3f2d3509f25afe19e7ffec4d3","observation_id":"f6e52eaa-d0ce-4952-b903-f137865b1e89","resolution":{"observed_at":"2026-05-11T13:21:17.432193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"2466cfce-03ff-4ed4-bf49-89198bf069c9","year":2021},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:838e7c4ac081058f957589c547960b762406c508c11c4f9bcd8040930a14ed56","observation_id":"ead073ee-97ef-44fa-9525-ef81d57423d6","resolution":{"observed_at":"2026-05-23T01:52:24.320248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-10T18:17:33.697242Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:74bfc81401ca2caf41dbe5cbe5594300d070fb34b6e53ec9c292ee926c713fac","observation_id":"16ef9c3e-12c6-4542-bc13-dc746c5cc050","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dcrm: A heuristic to measure response pair quality in preference optimization","venue":null,"work_id":"609408f1-6a60-4e37-9fce-9ee3512ab228","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:511d36fab1d39cdcd962f1f0e6c0b16798572a9d4149db4c99282ab5d7c73850","observation_id":"35977edc-4327-404e-9af5-ab41d386ea9c","resolution":{"observed_at":"2026-05-23T01:52:24.314439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models can self-improve","venue":null,"work_id":"993291b3-6f11-4afb-8c1e-9278893c8cb3","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:7d27e82873cc6296f5ad14dca9aa686f416d87d2f18eeda4a3a514a59c29f21d","observation_id":"e6e2648b-8406-4f60-a171-efc2ff33a10e","resolution":{"observed_at":"2026-05-23T01:52:24.317630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-07-06T22:14:21.107961Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c28b6f7790cc5c232f912758dd924673003f7999ba3a28833671b8f3bdff8303","observation_id":"df2ee1d2-1693-4e1f-85b2-8b40ec090896","resolution":{"observed_at":"2026-05-11T13:21:15.766370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:85d5f89602cbe4295dc1445ba3b31f6ae9adfbaaa1719ae4fc643cb317614677","observation_id":"46953652-3dbc-4c3c-b4ce-d0cec873f233","resolution":{"observed_at":"2026-05-11T15:00:28.883814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":"aa3eb51f-ff40-4cff-8aa1-fb7bb647bf2e","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:2af4cace2e65769e7742e65ceaf66a3323a0980edbb09e1dee12ad7ff711deeb","observation_id":"a918c201-3f10-4d45-90eb-574ba0ab1a87","resolution":{"observed_at":"2026-05-23T01:52:24.322811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":"fe95a979-22ff-4be4-81e1-397604f7a5d6","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:90c0e3a2d06da7c1c157bf54a422485ce4c9837f09407cfe243b7f1893eeb720","observation_id":"13561926-7329-4bec-a0c7-7d0a9ae73aef","resolution":{"observed_at":"2026-05-23T01:52:24.306823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24684","doi":"10.48550/arxiv.2510.24684","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Spice: Self-play in corpus environments improves reasoning","venue":null,"work_id":"7bf84ba5-f40a-459f-b34c-8a73545856b4","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:2265a6b17f98fc967279fb21fa04facaa69b8056962a31fa36a59b88e8223a9d","observation_id":"44782e97-3381-4c8d-bcce-60eb2d38ca20","resolution":{"observed_at":"2026-05-11T13:21:16.426077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.867858+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.867858+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"af21b8f5-3cd2-435c-bedf-6f515faf13c7","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ff25df1a896ac5a687bc6ac3bcdc85055f125775b2abbe5f7b7cecdc0405b17f","observation_id":"0cebd866-f376-4158-9a07-dd5a5d0450fd","resolution":{"observed_at":"2026-05-23T01:52:24.297173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advanced version of gemini with deep think officially achieves gold-medal standard at the international mathematical olympiad","venue":null,"work_id":"3be429ea-9dd4-415f-8e0a-a78335912645","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:93b1b313a92102628b275f5740fb9a69d79488cef4e9695d655ab789cec30c0d","observation_id":"23004da3-0573-4573-80d6-05c6ebcc779f","resolution":{"observed_at":"2026-05-23T01:52:24.354128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building trust in clinical llms: Bias analysis and dataset transparency","venue":null,"work_id":"03d0bb6c-22b1-41e3-9a5b-3dd735f47169","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:23628d5050de0a783e95852d8a09af637c7fceb35e763242ee037f19fc69cce8","observation_id":"6cc02ad7-93fe-46f2-a834-5e82891d9f13","resolution":{"observed_at":"2026-05-23T01:52:24.289794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eq-bench creative writing benchmark v3.https://github.com/EQ-bench/ creative-writing-bench","venue":null,"work_id":"ca40b61a-823a-4f6c-9f8d-cede0f1f1c02","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ab5fab125e63fcb735592ea70941162c70c325fe2e68750df6070b3b7de7d027","observation_id":"f58203d7-0612-46ac-beab-f7a969ec5519","resolution":{"observed_at":"2026-05-23T01:52:24.368160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":"78a9b47c-94a9-4f9d-b673-ccf2945bde0a","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:e97675d100c3a998e90eaebbf4920d6f31b6b8fa99c9ca082179e308837056a3","observation_id":"87aef807-ba0a-4b09-9a75-1a2b97409d78","resolution":{"observed_at":"2026-05-23T01:52:24.294895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23037","doi":"10.48550/arxiv.2503.23037","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"van Duijn, Niki Stein, Mike Preuss, Peter van der Putten, and Kees Joost Batenburg","venue":null,"work_id":"2ef68cac-3e16-425a-8584-a656156a326c","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:241443df4ee9d34858b009f6414c14257d8efd1cfc15e6e2875b035ac480a568","observation_id":"ecc7d154-0fe6-434c-b2ec-717878a2d5df","resolution":{"observed_at":"2026-05-11T13:21:15.039504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-10T13:57:06.874927Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:828d8c7f0db62329cbdc47f25005a8ef29658576628bb693160b67d2b69fc5c1","observation_id":"a9194573-f9b1-4726-a93e-d20276e60934","resolution":{"observed_at":"2026-05-11T13:21:15.477936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"384f32e1-14c7-4216-b925-c5603794dff2","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:701c216eacbbd3e787a6b0011db3b84d1002212dcea5211bb26082896775c381","observation_id":"b906ade4-0446-4b02-979d-2b8156a451d0","resolution":{"observed_at":"2026-05-23T01:52:24.299211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutherland","venue":null,"work_id":"7bce20e6-7eca-481e-be1d-34a66f7fb082","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:bb339192d4dade4a53d6f0d0b92ada24bc09d99b88127b3ddd8a071855f7ffd8","observation_id":"3cf4977f-485d-41f4-aaa5-3b550ffc7f41","resolution":{"observed_at":"2026-05-23T01:52:24.351536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:34:40.450481Z","title":"Karl: Knowledge agentsvial reinforcement learning.arXiv preprint","venue":null,"work_id":"f0fbb5d8-dcd2-4d16-8abb-d042b2b19d66","year":2026},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:9459b2ff1c3492947dd5d05495d1464bc81bb39da5b429c8fafa785ca7dd5b00","observation_id":"b446829e-512a-4c08-b734-14fa0f269c19","resolution":{"observed_at":"2026-05-11T13:21:15.049063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:49:44.762854Z","title":"Online rubrics elicitation from pairwise comparisons","venue":null,"work_id":"997bca21-08ad-4445-841f-1609abeb4657","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:32802e5fa8c5dd4831136b6a1ccfcb17741037c8915cbd757e0846d5130932b4","observation_id":"baea06cd-7924-41b9-9015-7b0e5ff2c439","resolution":{"observed_at":"2026-05-11T13:21:17.015919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:fed0d02774b01328a90c448ae8d19536e346da42eb3b039a9c4b9feaeed719b0","observation_id":"fcba67ff-a40e-41c0-a2c7-7c2a4c532907","resolution":{"observed_at":"2026-05-11T13:21:17.128690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:25da56724771c83e7346ae3ecc2860cf48fe69fc89e072958368a67534a4b4b6","observation_id":"8f0b2e61-a066-4b38-b789-48f668c93a99","resolution":{"observed_at":"2026-05-20T00:00:28.487879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:53:50.245781Z","title":"v 1: Unifying generation and self-verification for parallel reasoners.arXiv preprint arXiv:2603.04304, 2026a","venue":null,"work_id":"7bbcc938-b7ac-4ba5-83f9-e8f0a7be8bb3","year":2026},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:6e78e0da4cb2b31fbf5fc0a6204e20b0aa7d23354b5bef365904bd313b5f8083","observation_id":"0fdb52c6-4825-4dc1-bab5-1f2408888556","resolution":{"observed_at":"2026-05-11T13:21:15.655944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Book titles and abstracts","venue":null,"work_id":"174a3d6b-2493-4fe1-95db-f13e2ec9ded3","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:92758de1c76fba37e2542edcf225b69fea99b783607d99b06512973fb5d0671d","observation_id":"882aaab8-7a17-4de6-8f88-86d8b69a5d45","resolution":{"observed_at":"2026-05-23T01:52:24.345305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the gap: Examining the self-improvement capabilities of large language models","venue":null,"work_id":"abc7cb4c-161e-4a2f-9de3-83035bf4ce50","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:d678f5cde8b2ae61ee22e840e9a1b202b3842867d05da9487ced80ef9d1aeb33","observation_id":"004af272-0f62-4965-88bb-d0c37e4a3a2b","resolution":{"observed_at":"2026-05-23T01:52:24.278955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-07-06T18:14:03.830337Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":"2405.08448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-07-02T03:46:33.108981Z","title":"Understanding the performance gap between online and offline alignment algorithms","venue":null,"work_id":"92c35cdc-3e32-404d-a038-8a1f4228a044","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:45d266a76457f0e5156751954f4f94f53f37821ca694295a5789d17f695a9d0a","observation_id":"a16b9864-e86d-454b-844b-7afae12100a8","resolution":{"observed_at":"2026-05-11T13:21:16.758349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:a0dfa0d374812725e4796bbdcd64e4392481fb83e3730254101f0dda922d145e","observation_id":"d3c19b3e-ed8b-411a-8b86-303893dc19c8","resolution":{"observed_at":"2026-05-11T13:21:17.585101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:fe94b85d35211ee4751b3b98edc4d71b5d9116368d9b7dec703692ba10d23659","observation_id":"2d8c22e1-6318-4674-b612-7b551211262f","resolution":{"observed_at":"2026-05-11T13:21:17.816751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":null,"work_id":"bc691af3-f586-4f09-a6e9-43bf3f039607","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:fbc0cf533661770390c5c8df97ccac244303e240da89447484dc96549efd4165","observation_id":"181960ab-b1c2-485c-8966-4aba5b9046ab","resolution":{"observed_at":"2026-05-23T01:52:24.340812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Checklists are better than reward models for aligning language models","venue":null,"work_id":"bfdf0b04-ee76-4835-bf6d-624265160d13","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:37dc6e5f8182fdd26ec695d56de08ded32a2a77a74ce9e36f395a80dc63be3ef","observation_id":"eb4e54e2-abdf-414b-b079-7117811a630e","resolution":{"observed_at":"2026-05-23T01:52:24.338244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"5c6ccae3-c0a7-4f08-996d-37e2a2ce96ed","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c47c0518455ea1bb00abb465f7faa3a5f2c6c1b328d35c98ae318c6249d3ac59","observation_id":"f2bd45f3-8fbb-42a1-912d-b190b80ed32e","resolution":{"observed_at":"2026-05-23T01:52:24.276123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-rewarding language models","venue":null,"work_id":"f0ddd071-8e28-497f-95d7-4ea442eb8182","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:b62c7b8b6e20da0df0343c974262a9980114fb3148ea70ba5192fdf1a78dfb33","observation_id":"c0593d53-32db-40ea-8e65-eccbeecc140f","resolution":{"observed_at":"2026-05-23T01:52:24.281802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:17:30.419305Z","title":"Better llm reasoning via dual-play","venue":null,"work_id":"69e8fa8d-6fef-443e-a767-f84822fc8d0b","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c4073c88d96eaa01adbcdc9d9280208fef62d3582ce36fac866aac6dfa36074d","observation_id":"fdfe0c9d-e0e2-414b-9b12-156e970004f7","resolution":{"observed_at":"2026-05-11T13:21:17.500054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":"2505.03335","doi":"10.48550/arxiv.2505.03335","metadata_source":"pith","pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-07-10T18:17:33.800267Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","venue":"cs.LG","work_id":"b59092c4-76ed-4c78-9006-312bde2e40a6","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:99b052771a2fca73565d7302b1392beb3318f6fd009a49d3784ca11a79e88b20","observation_id":"26d16d03-9b4c-430a-b486-f55d7916c973","resolution":{"observed_at":"2026-05-13T18:23:09.397455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"ddba11e9-380c-4ab3-8a7d-9f2ebfeade6f","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:1f92d3dd80768b1831479f50d5158f994a930d4c425f4251ed03ffc1cc8fded9","observation_id":"d22ca3be-823c-4c42-84d8-f51a07a433b9","resolution":{"observed_at":"2026-05-23T01:52:24.284299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:6f12a820af19045d198e7d0fd6eabf688a829a5952e2540090f1a1c792b726a1","observation_id":"c794d79d-057f-49d1-ad6a-e9b15a81eba8","resolution":{"observed_at":"2026-05-11T13:21:16.695019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-04T17:26:10.792313Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-04T02:23:17.018487Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:705d0074c959a3896cf50a16ed3957db662dc3e832cb9db0415e34f3d01527db","observation_id":"c8b42532-f4e1-44ed-84cc-8cc5bb2445ca","resolution":{"observed_at":"2026-08-04T02:23:17.018487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-07-06T21:35:03.439393Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"cited_work":{"arxiv_id":"2506.01716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01716","snapshot_observed_at":"2026-07-04T20:40:08.275113Z","title":"arXiv:2506.01716 [cs] doi:10","venue":null,"work_id":"f17aef0d-21ef-4877-b0a2-e7492e1d481f","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2506.01716","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:93bac2e991dd1c9c93631c3df739d16f35fa184ec41707d9d2dbf44023484312","observation_id":"ec11e069-6aa6-4de0-9353-d988fd8028ef","resolution":{"observed_at":"2026-05-11T13:21:15.160379Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3327ede3-c8af-4137-a200-d93e53a18db5","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:9fd1da3dc272f6d2db6626324ab730faf15e89bda343942db4a77bc8e8177ded","observation_id":"8e7bbc34-6935-49cc-83fd-12c915292c90","resolution":{"observed_at":"2026-05-23T01:52:24.271410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a51cb668-8b26-4236-8138-c2dcf3248721","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:6885fed77113587fcb4172341134311c8e96f6726a77b303e6692180587b0755","observation_id":"400b7898-0135-480e-9c81-e19e4b02b72c","resolution":{"observed_at":"2026-05-23T01:52:24.359068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9c509d6-b31a-486d-9bbf-e74e87eb4a72","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:efa1767cd942293032ddff66ed15358f4b2040c02175b3f5d82413d50c4825a6","observation_id":"b089ffea-c2bf-482c-ab3c-5383421a50ec","resolution":{"observed_at":"2026-05-23T01:52:24.273495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enzyme Identification","venue":null,"work_id":"7a7d4d42-1fc8-4b0b-9c9f-0c004c823eb0","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:7c5fcd9a04eec18f9a45e2e56e4812cf43da436b33b7936c656aec81630c6be1","observation_id":"5383c140-1ba4-46a1-a067-85939b894728","resolution":{"observed_at":"2026-05-23T01:52:24.287023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1bd9104-66d6-4213-992e-9e3e8b37c974","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:d7975b5c80ecf72df0ead9b5ed88f47054a59cf1416dafd95c8c18837be9f3c1","observation_id":"924c6ae8-f303-4138-932e-be8ec1d40f06","resolution":{"observed_at":"2026-05-23T01:52:24.304236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Figure 44: Query (Instruction Following)","venue":null,"work_id":"288ebf08-3bba-418a-93b3-b1908cf4acef","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:986ef7d7826fbe087b9aa8aaf85bb8d14a4954727b7e02c9741ac2c13af3615f","observation_id":"f72c0fbb-70ca-4011-b8f8-c017c65e93d4","resolution":{"observed_at":"2026-05-23T01:52:24.325189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9aba7a6a-49e5-4785-8d39-d586558ace51","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:f1d9bcdc29e6cc212e3f4abfee76060b73187cc53b5b19ac3384d1315ce9b6f2","observation_id":"1feccc5b-73fa-4e8e-950f-4968331f9809","resolution":{"observed_at":"2026-05-23T01:52:24.292393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"criterion_1","venue":null,"work_id":"cbc7222d-1d02-44bc-b3c9-361a0b9b900c","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:b1799494fd705d1daf49b2c74c5053de816f0a4aa378b792687a094b9c9d1ae4","observation_id":"c7a45f16-28bc-4b44-b3bb-50d36e1f2d88","resolution":{"observed_at":"2026-05-23T01:52:24.301430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"He stated that he would continue to work within the framework of the Philippine constitution and existing governmental structures","venue":null,"work_id":"19a7dfe4-4c1e-458d-a00e-3aefa7d7c929","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:563e9a20c74f22f386e286763d934a39b7be96b1d18854b22d1f7e6b0ec88c82","observation_id":"2a659855-aabb-49c3-bad4-a3e3de8d1645","resolution":{"observed_at":"2026-05-23T01:52:24.311963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"name\": \"Correctness of the first part of the answer","venue":null,"work_id":"6a01c103-179a-4b51-97b9-10126748b18e","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:1e224293ef70b21d31b28d29fad24cd8bddd7eea2dee524e6455e9c30282f593","observation_id":"bea8f7a6-a5f0-47e3-a56c-49d776582e49","resolution":{"observed_at":"2026-05-23T01:52:24.266993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"He stated that the declaration was made under duress due to threats from opposing groups and to protect national interest","venue":null,"work_id":"66d9bb26-ad7e-40b1-af3b-3cb6dbb0c362","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:9f209d8e163c3b66d4d6855b05d8ae3c7d634e0459e8c733c5ac30d4cd294457","observation_id":"4c7e9617-7256-4cd4-88ef-a583aebe27bc","resolution":{"observed_at":"2026-05-23T01:52:24.348055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"name\": \"Correctness of the first part of the answer","venue":null,"work_id":"ae251157-1020-41d8-9ca2-0ed41dbda8be","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:a9b76cc26f5e2054a7155be5fa57244c7f8f7ffc20274f319ea1522d4ec54e81","observation_id":"abfbb882-59a3-4b30-b198-13856b5b3055","resolution":{"observed_at":"2026-05-23T01:52:24.384418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"098d109e-262f-44f6-a2ba-29ddd2578430","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:fda43d28cbdb3e66f0fcf67e65944effb54e8b4b4f24ec2e1ff43aacd7ee89b3","observation_id":"e573b348-c5b5-4967-8abb-f7271f4bf106","resolution":{"observed_at":"2026-05-23T01:52:24.262169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ensure that it is necessary and sufficient to use these facts to derive the correct answer to the problem","venue":null,"work_id":"7caa4c23-3329-4f4a-99e9-614b0d7c9126","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:4417a8dde6fab4a4c493eec098994b08d6a5be68396fa285955255ebb7f623c3","observation_id":"c6c0fe7b-fe19-416e-a416-8d538ddf34da","resolution":{"observed_at":"2026-05-23T01:52:24.382216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"* Provide a reference answer within <answer>...</answer> tags","venue":null,"work_id":"c725438f-95cf-474c-b192-6312d95c3b6f","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:4cae63881ede6a87e4bc88a033b72c2f284f5744318631c4e71502216fdc0032","observation_id":"b908ea69-d599-4d05-a49e-8de5f4d22450","resolution":{"observed_at":"2026-05-23T01:52:24.255746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffb1dcf9-0361-4703-a520-7b2a2e9f4064","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:b7b792831911c44682490a24383a16db77cc630dd70b5fc3a04b7b912dd77bc9","observation_id":"a32a39af-36e9-4b1e-8309-4265a1689059","resolution":{"observed_at":"2026-05-23T01:52:24.259907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"## Format * Enclose the question statement within <problem>...</problem> tags","venue":null,"work_id":"1c443472-786f-41f7-9df9-738536d0b28e","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ca1bba47a44d9fdef6760d6afae7d89d64bc93a6a69e381118f8ce847493f501","observation_id":"ef5d8dc3-4013-404c-941c-8e7f960e1109","resolution":{"observed_at":"2026-05-23T01:52:24.264469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"according to the text sample","venue":null,"work_id":"b88c677c-105c-4e2f-ad10-a447db0da631","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:e2d308559041fc3e6a8a342fdc29224edf248f00b9bcee7fc92855438d477593","observation_id":"40fc4e96-66de-4203-b52b-5e63518f6c62","resolution":{"observed_at":"2026-05-23T01:52:24.330038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9171e904-2a80-4ef8-b9a1-c4e52dd6e3dc","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:cf085c7bd3a1ee7465fe4464a28027001c35656984bcb1edcb9a2bf147a68cda","observation_id":"8af7f8f5-6931-4834-a013-b780d491fdc4","resolution":{"observed_at":"2026-05-23T01:52:24.363704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Length: 1000 words","venue":null,"work_id":"da4f9ccc-0543-4691-9462-67fe8bc30200","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:4859ba3bdce2b7810f9e35205f8c202ced24d8055969b884f18e02076e413bdb","observation_id":"9ea86125-3e8a-4cca-893d-2c0ad75b6d66","resolution":{"observed_at":"2026-05-23T01:52:24.361507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"according to the knowledge","venue":null,"work_id":"21f29ab3-55f0-492b-8f80-2ec0bd15e0b4","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:2faa4f6a432979fcc60dd6bf4d9e16a29947f358f53474550bdf54d4e8fc337e","observation_id":"4134d31f-b407-4820-a9b3-136d3806fb2b","resolution":{"observed_at":"2026-05-23T01:52:24.365723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"criterion_1","venue":null,"work_id":"2ae4f186-5173-4d07-923d-beab7100669e","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:d68a15b71a4ccf89af03659b72f7951974e133619bf4b4042d8c93ff02b0fab4","observation_id":"d778a6bd-ac8f-48d8-9a0b-f68d07aa19fb","resolution":{"observed_at":"2026-05-23T01:52:24.386631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In general, the reference answer should have a high quality compared to the candidate answers, but this is not always true","venue":null,"work_id":"73f979cf-d058-4e33-98cf-fabca59ff464","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:b891c0341468cfa8cd5927c01688d651bf772b30fe44c04245451fc5761f7e00","observation_id":"bf01da50-c8c1-499b-8678-5d123539d64e","resolution":{"observed_at":"2026-05-23T01:52:24.379607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f61a4e0-fa30-41c4-b6f6-d56ffe6eaa9b","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:63be624d6a8033404c11eb83d66191b61e0317cc2f0054a76884942d964843db","observation_id":"994a32f2-05a2-41e0-8a3f-2c3120e3b373","resolution":{"observed_at":"2026-05-23T01:52:24.372941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"factuality","venue":null,"work_id":"446f0e0d-0181-498c-a78e-2c74f603a421","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:2d52f0e0bcd4c121a029a0b6331e1e41f86ac63995fd32e8fb3b3ca4116529c5","observation_id":"a7f4a737-b37d-4a43-80c2-08d93a67021d","resolution":{"observed_at":"2026-05-23T01:52:24.269116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"YYY\" of","venue":null,"work_id":"7d19de6d-93ff-44b8-b2ba-c06ab4800e31","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:80d15003dec4e04add8980fa42e525d934646d04f590ef4ff5835edc25e50f0d","observation_id":"e54c8d39-e205-41e6-98bf-944ee822c9c0","resolution":{"observed_at":"2026-05-23T01:52:24.327410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not applicable","venue":null,"work_id":"954d8d87-743a-4565-b544-4a559025c716","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:8cab921a3fe44dacbbb4a183a60d80aeb11086a11229356e91bed1d4e2595899","observation_id":"97e0a20b-77e7-4aca-ad10-aece5e24e217","resolution":{"observed_at":"2026-05-23T01:52:24.370694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XXX\". To describe it, instead of saying","venue":null,"work_id":"d369ced9-c192-4ed3-9a9d-33dbad863e34","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:82125f01230828eb5466b4b9378685ece778965addc93fee379f581d1d51fe2f","observation_id":"ccd96c6c-c2a5-401b-8cbe-6ffd1ce1abf2","resolution":{"observed_at":"2026-05-23T01:52:24.375045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"criterion_1","venue":null,"work_id":"88f018ab-fe0c-47db-8187-6e3eb15ed7d5","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:451fe7a8c43edf80c7bfb0a6d21be1755597da6e85cc5b01e862e88d2a4d10c6","observation_id":"e80b7bcd-7cdf-42d8-bdbd-e244093b742c","resolution":{"observed_at":"2026-05-23T01:52:24.377227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":10,"verified_exact":23,"verified_fuzzy":41},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 2 inbound Pith citation observations for arXiv:2604.20051."}