{"as_of":"2026-08-17T17:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c435b8fa73d2ce3e769f89407e747d9efd56c7997cd977ed176e2f60c761194c","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:07:05.170825Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13358/citation-record","integrity":"/paper/2506.13358/integrity","json":"/paper/2506.13358/citation-record.json","paper":"/paper/2506.13358"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:07:05.088037Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.088037Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:fefb458ace07b79457eb19887dd2702b421232c06e694c46da209903658863b2","observation_id":"43422694-5fcf-4c9a-8120-5b6f48571be6","resolution":{"observed_at":"2026-08-15T20:07:05.088037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:07:05.093314Z","title":"Deepseek-r1: Incentivizing rea- soning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.093314Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:bc8d935877ac54f368d88b000c1412ec57f82c59d171c1a9886a30c2e9c40246","observation_id":"8e02623a-a6b6-4c28-aa55-e5469dce6ef9","resolution":{"observed_at":"2026-08-15T20:07:05.093314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T20:07:05.097482Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.097482Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:e1f8394900a4dea950503d6d4deb929e7482371ab03d43125e52855a1407ff16","observation_id":"47c59f1e-7650-492d-b43e-f500f4b2b15b","resolution":{"observed_at":"2026-08-15T20:07:05.097482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:07:05.101687Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.101687Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:c46c70c458bcdc255cdf1687f56d40f3030551afed4896e45a37040896370370","observation_id":"20db525f-4548-4f5c-8824-2f87469da143","resolution":{"observed_at":"2026-08-15T20:07:05.101687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:07:05.105719Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.105719Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:9dd8abc582f86f05e7aa0cf69d6df8782eaaf070d24cab649ca65687833b9771","observation_id":"3fbcdbc4-e47f-431c-92ff-fdabb68813f8","resolution":{"observed_at":"2026-08-15T20:07:05.105719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-16T12:43:05.556743Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-15T20:07:05.110212Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.110212Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:0494bc5db266daba10866be3fa5570006a1e223c2bff276f90e4cd8846704992","observation_id":"f77a8b28-5f4d-4a83-996b-b80cfc92e079","resolution":{"observed_at":"2026-08-15T20:07:05.110212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.114855Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models.arXiv preprint arXiv:2503.22342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.114855Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:00b6c55ae44ee48cec340dee91e01b2f635cbcfaed22b57201b50708ed04aec5","observation_id":"ff884a3e-0cc3-486c-8992-0839e1b10db6","resolution":{"observed_at":"2026-08-15T20:07:05.114855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-16T12:40:48.744732Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T20:07:05.118325Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.118325Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:a7ab2d936ed5fa5b08cf161b392b6671289b150f60785d446eabd3abc6efd6ff","observation_id":"130bbb4e-c597-480b-8b5d-2e281be011ba","resolution":{"observed_at":"2026-08-15T20:07:05.118325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T20:07:05.122252Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.122252Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:5336166cafa87814e57d204f66e0c66e6dc46a49259be81181d60c56b9cb3b8e","observation_id":"c1645e46-7316-44d4-a1a7-504f8ffb1115","resolution":{"observed_at":"2026-08-15T20:07:05.122252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-15T20:07:05.125995Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforce- ment learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.125995Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:e81984c5f6faa321ec3bb6359641fb12851b99341b678e120bb999fed49ebbfa","observation_id":"7f6ed1be-52b1-4235-9376-f13db9efdac8","resolution":{"observed_at":"2026-08-15T20:07:05.125995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-15T20:07:05.129778Z","title":"Not all rollouts are useful: Down-sampling rollouts in llm reinforcement learning.arXiv preprint arXiv:2504.13818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.129778Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:8adc4e6772afaaa62ae15b2513c377f53291ae8f4d3dd96044aa61b387f8aab8","observation_id":"50851a1d-8eed-4cbe-a43b-c5ded3787f5e","resolution":{"observed_at":"2026-08-15T20:07:05.129778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:07:05.133492Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.133492Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:643335da535d25025794e2c54d84f6e617a8d38f0b9e593e3ac801b8b1c72152","observation_id":"33be6667-9526-4d82-9891-906ba17f7781","resolution":{"observed_at":"2026-08-15T20:07:05.133492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:07:05.137196Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.137196Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:f106614d1fdfab4f0a5248a2c204627348f660c558cded18ce8ad70dca3c5424","observation_id":"e4e1e4f6-7bdf-49d3-ac38-d51304b4600b","resolution":{"observed_at":"2026-08-15T20:07:05.137196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.141038Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.141038Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:46ccfdf6b935617e4bcd193cd4964c81d92511bc0a98730108d97a728615e19a","observation_id":"ce31fc07-e1ba-4d81-9984-d17d18c164d2","resolution":{"observed_at":"2026-08-15T20:07:05.141038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T20:07:05.144490Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.144490Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:9a6121fbbd30be6ed596058b25b64533ae336ed18f0ee6e24fe4703bb17d2551","observation_id":"c857d0ab-e713-46b6-af00-64917fb18109","resolution":{"observed_at":"2026-08-15T20:07:05.144490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.445144Z","title":"Training language models to follow instructions with human feedback.Advances in Neural Information Processing Systems, 35:27730–27744, 2022","venue":null,"work_id":"7d1169de-43df-450d-baf6-66478c62a57e","year":2022},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.147982Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:104e318584ef80c97756b646361acb918fcbe6742050383831bef3620ae01d08","observation_id":"13f9409a-e21a-40e5-83c7-f305397d52fa","resolution":{"observed_at":"2026-08-15T20:07:05.449047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-15T18:13:42.319653Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-15T20:07:05.151276Z","title":"Rlhf workflow: From reward modeling to online rlhf.arXiv preprint arXiv:2405.07863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.151276Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:407008963bfa418c7e9b1941d86d38374f210fc75580be5cea2c4a0b1c11c11a","observation_id":"3729b848-3a45-4c30-913e-ed62d1d62d20","resolution":{"observed_at":"2026-08-15T20:07:05.151276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.154786Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.154786Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:e122e267598695d6d9f9e11619583217d4c97c1e61b057711318475d7e7c8dcf","observation_id":"7577c151-8838-4f33-a636-e8f41ab32d04","resolution":{"observed_at":"2026-08-15T20:07:05.154786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.157904Z","title":"Self- refine: Iterative refinement with self-feedback.Advances in Neural Information Processing Systems, 36:46534–46594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.157904Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:eb844289a916b9a7e311e40da7846e83e19265092bb86c38136963896f004e45","observation_id":"06283bf8-86ae-4bad-b5b4-55fab025bcaa","resolution":{"observed_at":"2026-08-15T20:07:05.157904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.161052Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.161052Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:1f0f96f9f62d0d2340f84e708f93aa5d1b50ed2a2dfb2c0ba158a1829869213c","observation_id":"20ed0976-138b-4920-bb1e-91c25288168c","resolution":{"observed_at":"2026-08-15T20:07:05.161052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:07:05.410620Z","title":"Constitutional ai: Harmlessness from ai feedback, 2022","venue":null,"work_id":"f207d588-aab4-46a1-85c1-c6dff6b412f0","year":2022},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.164067Z"},"links":{"citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:db8fd4602d132a3ed5d7e823d4bebd5d0d7093401a826d76093fb16326f08c3c","observation_id":"8687d532-d921-48a9-a935-675ad2f9d2e0","resolution":{"observed_at":"2026-08-15T20:07:05.416091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-16T21:10:35.590654Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-15T20:07:05.167331Z","title":"Beyond the 80/20 rule: High- entropy minority tokens drive effective reinforcement learning for llm reasoning.arXiv preprint arXiv:2506.01939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.167331Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:1c1be47de843d748d575114a3428cc9a97b4428951512d3baf126209e395f29c","observation_id":"b287acd4-044a-4b8a-b0af-c882bbcc7c44","resolution":{"observed_at":"2026-08-15T20:07:05.167331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-15T20:07:05.170825Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization.arXiv preprint arXiv:2505.12346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.170825Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:07e499c2db4f84b30713f7e1bdff3692c355cc06e37aa417e49377f8ba8539b7","observation_id":"0b9f6000-6e9b-48f9-87c5-38a7c22a23d0","resolution":{"observed_at":"2026-08-15T20:07:05.170825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.13358."}