{"as_of":"2026-08-08T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09616ea9508d1990e8e9e9f95332f87866661c83dd3a7f8b3632349685366da8","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T19:23:10.328625Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04412/citation-record","integrity":"/paper/2607.04412/integrity","json":"/paper/2607.04412/citation-record.json","paper":"/paper/2607.04412"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:261ecb210063fa08631632cd7a0ac5d4b98b70cbe9fd5968e85be160502ea51f","observation_id":"86ca782d-3e33-40d3-9bff-62a237458a54","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:b6d477fecab5ce6de944c79283ad8ac9060670c189f4e51f223b440accfce01e","observation_id":"2d87c94e-8486-482f-a55d-a04a067b6410","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Michaud, Jacob Pfau, Dmitrii Krasheninnikov, Xin Chen, Lauro Langosco, Peter Hase, Erdem Bıyık, Anca Dragan, David Krueger, Dorsa Sadigh, and Dylan Hadfield-Menell","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:b92c147236046c6ae9c9a714b4c50d0d89ff95da828360e6e14d94adf48bbbfa","observation_id":"67c3a10c-c837-4e45-ab52-cdb093e1daac","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Christiano, Jan Leike, Tom Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:790e58c4834044536f373a020dc31ecc0ef1ff58c489ce81aae8fe3875856b74","observation_id":"1f201116-9926-4dba-8371-ccc8f0416cd6","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:1832c10c99bf432c4b8ee6510ed58e1f7299a582909f59b1cd93183637fae133","observation_id":"c7525426-0c1d-4d56-9d41-89c4128777ad","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:129a1a9488a114bcf4a840267626b72dc580257107284127843090f6cb80724c","observation_id":"bfe5363c-8cd6-43b6-8511-d624128d2c81","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Advancedif: Rubric-based bench- marking and reinforcement learning for advancing llm instruction following.arXiv preprint arXiv:2511.10507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:aeb2961c9f204e3bb6d53b625e09197e419533475d4d544bb8ee0154da4a179c","observation_id":"4a067c88-8e7d-4ff9-b524-31d4db693b3e","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:524f83726922a11395d935f79f709c04d890e8710e95e96141885ca6ebc83e2e","observation_id":"ec597410-04d9-4162-9c9e-1b79e06bf902","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Large language models are reasoning teachers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:ab757888c652a5a655e775bcb001ecec7a90a8893f521ba402b46864d43d9bf7","observation_id":"70b3b8f8-8bce-4f17-8ae9-08b994026120","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"R-zero: Self-evolving reasoning LLM from zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:2675b1886c613e23b4bd88edb0117fb4590d83cab42a50540d1de658f547d0bb","observation_id":"10135b71-3735-4e28-ad15-dad414f60591","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Vcrl: Variance-based curriculum reinforcement learning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:383d83be7f8f5e0faf98f6c8137797f42d61f62a1b9ee86172236b2dac7baa35","observation_id":"71a1ee3f-722b-433a-b011-e4cf3f80c624","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Followbench: A multi-level fine-grained constraints following benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:5f4dfe511823af6bf20a4687a6971894faf0bd10db6c1de5cb9a0f513ad08296","observation_id":"3f2bc3ba-3117-405a-b674-af0cc9a9f8b8","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:939a81cc0f070fb86c1fbf7b650f0be8bc09ae7961b0d1e720f2515901b75d9e","observation_id":"7f84151a-9e60-47a2-96a0-3e0a6fc49322","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Language self-play for data-free training.arXiv preprint arXiv:2509.07414, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:fc2b0bc53151f12ee1f54b25d22326dfb228558d7ebb3a280c5b73d434bb15d2","observation_id":"8c0fc07a-24b2-428d-b102-4531fd40fac9","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:0b2ba9156255d0af9e816860cbb486342d6d7880bb1af610c60afbf4bd48c91a","observation_id":"ab0e0874-f0df-400b-a20f-d5bfa6ccf4f9","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"SPICE: Self-play in corpus environments improves reasoning.arXiv preprint arXiv:2510.24684, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:c45fe62a25374136e343c8d060b829df4b2bdb4c90277a7e298e8b00989d547c","observation_id":"7e86ef38-5da0-4936-ae8d-2890fc3262d7","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Openrubrics: Towards scalable synthetic rubric generation for reward modeling and llm alignment.arXiv preprint arXiv:2510.07743, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:dd25c11f8cf685d0af52fe8691e58bc7a264dc95aeee3897efb90af6f66d8d49","observation_id":"2b7f806a-675f-4eca-a3ba-3f1f26204c5d","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"G- Eval: NLG evaluation using GPT-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:75eee459c87395833dff65c356eacf6ee5562a9de0691d2f9ace208c24550b74","observation_id":"e89443e7-8cb3-4988-a80b-b78964317481","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Aligning with human judgement: The role of pairwise preference in large language model ev aluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:b69dc32f3de6fdab996aea1153437abc5660ce3d7755ae2a24031d906e8e0ed5","observation_id":"5687cb72-c2ef-4600-b05e-73c575c5c4d6","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"LLM comparative assessment: Zero-shot NLG evaluation through pairwise comparisons using large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:3985b63128944ddfc3c867b70b1d618599ad7089aa688337cdb8dbca33d0136b","observation_id":"e55804b4-9c82-41dc-bb7c-b7f481b1ef26","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Teaching small language models to reason","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:f8c051e9f03c871476a0e1c386d56e4d099004169c0c1fb12ed6c8e22d014d11","observation_id":"983e9400-539e-405b-866e-a1491cdbc756","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:213072ede552a6c3d0ff412bed5fe3e56e1a7ec2ee279f6d8ca070f4ed5d9338","observation_id":"1278c5ee-1690-430c-bdbc-3e3d2874e800","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Infobench: Evaluating instruction following ability in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:710c35e1bcf0ef5eb15ba210ec85036405932c781d0df0af5c7b927732d6b0b9","observation_id":"f35c9b4c-b09f-4ce6-8843-6f0de04c0504","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:3a15d1e9180a2a718b752d8fd30d1115ea614f0677c400533a93192fbb3c9a5c","observation_id":"2bce996b-8755-4747-b4dc-2fe50057cfac","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:ec9a736cc71523573c3e1d6364caa774e48f414df7cb78119ead0072754855b9","observation_id":"2aa8ab28-6e57-4d51-8fd6-89f7137d66ab","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:d58c7802dd1929ca10f90005a3e79e795d41bc4f9523807af3fbcb1b0b3540a1","observation_id":"2f65330f-e8bd-4e57-8198-5616dd2a66d6","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:0a40d310e766bcdfc56c95657a03547f500487d63b4b63a081458073ddbd5649","observation_id":"1053f9bb-bfb5-4c7a-aa61-bd5c0dfc8d9d","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:7b580a7f80dcf2155b9c9261db9fd2a6dd0b884f4aa162454e8f8c0c3f0dd2ae","observation_id":"ca9b0ce8-4367-44b0-8725-92dfd438c0cc","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:9cdbdfd83c481ed2e3e9db88b9aa1572bbb9b2fe8a7d4cd54f7d9c943ba5253d","observation_id":"38e24633-ec37-4cc6-b08f-13e96808deae","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:9b109cfc87499d48012ea83f976313c538070a3dcac3affbba34cbc41a79493f","observation_id":"6c52ea9e-8729-4ada-85cb-f5d7487a4626","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Proximal curriculum for reinforcement learning agents.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:6d185288ae76921c0ae4d9d9ee4c208c3e95a79319b19436bd4453281eeb87f8","observation_id":"b52b05f8-23fd-4f93-9e5b-f95633968524","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Checklists are better than reward models for aligning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:be47a31310a87de9190b96b4cf417cc8406e854365d46b24a58491cc9200319f","observation_id":"8fb5304f-16d3-423e-bbc4-f6616d4033a6","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Williams","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:1b90cec841d0a021122bc532698be39bcd75fc96f09810dae078344beb7419dc","observation_id":"be063aa9-ba5f-49f8-9873-c5a00b58fc70","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Wizardlm: Empowering large pre-trained language models to follow complex instructions.arXiv preprint arXiv:2304.12244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:da4048ad9b933a34cdd853efa800f3890b027dde9e55ec0c28a2d4630b013c1c","observation_id":"337e28fb-23ad-4217-b57b-4dd1cc1dcc5f","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:dec597ea8db0b1d787b40ebb39c37cf28e19d2350cac2b3dc6f6e4a21d6498f5","observation_id":"6a9f4e00-9704-4ff9-85f3-e8357cc351ab","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00062","last_updated":"2025-04-09T19:53:54Z","snapshot_observed_at":"2026-07-06T19:43:09.889618Z","submitted_at":"2024-10-31T08:15:32Z","title":"Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00062","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Le, Qijun Tan, and Yuan Liu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2411.00062","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:a555f11e53cc72374f6578c13c2d0ee0e29e31b448325febddcfab1be5e94a06","observation_id":"7ff97028-1fd7-4a5f-a61d-4d5f6b572086","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:788975891a2e68581b5ec733de466da86045e3aef86f5c4518c115b7896cccfa","observation_id":"004c5abb-9941-4284-85b1-43c7f583578b","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Wildchat: 1M chatgpt interaction logs in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:0ae618aab266609771ffdedd870f1d0c64f568a83036d3e17f605fd841e907b3","observation_id":"88526c1a-bb01-437b-b255-0f591bb5aaa7","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:879d3a77c40a15273c9cef67a970e45a735197b3295355e07be0e637074ccd6e","observation_id":"252353ac-9d46-432b-a971-9ed7b3db867e","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":", and the criterion might be","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:dcc0e284cf8f47205d1bc5478fe2045cc1cf82bd72b27bea8b3980af900f23ac","observation_id":"68d79dff-b85a-4d60-ae93-6e56fe66c968","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T11:50:19.083976Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.04412."}