{"as_of":"2026-08-10T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8aa77326c6dc815f53c0b4fc435d26f80a4e8244c49b276a33f9cd2e903c4c0f","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:44:15.804741Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.23730/citation-record","integrity":"/paper/2509.23730/integrity","json":"/paper/2509.23730/citation-record.json","paper":"/paper/2509.23730"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1705.07830","last_updated":"2018-03-02T16:02:24Z","snapshot_observed_at":"2026-08-03T16:43:36.460747Z","submitted_at":"2017-05-22T16:19:21Z","title":"Ask the Right Questions: Active Question Reformulation with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07830","snapshot_observed_at":"2026-08-04T14:44:13.454741Z","title":"Ask the right questions: Active question reformu- lation with reinforcement learning.arXiv preprint arXiv:1705.07830,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.454741Z"},"links":{"cited_paper":"/paper/1705.07830","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:871e2421bdf8f00a67e8dc697810d78dbc747909f04c8da20a98961a7aa906e3","observation_id":"62e5f660-7ad1-4646-bbbe-0adcc5b60b7c","resolution":{"observed_at":"2026-08-04T14:44:13.454741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-04T14:44:13.604742Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.604742Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:e8d59f358965f73d367bfb77fb99ecad67f24920f53db7875b1babd2badb6c82","observation_id":"a2f5499a-556a-4cb9-b502-68a2b81a64ec","resolution":{"observed_at":"2026-08-04T14:44:13.604742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T14:44:13.895720Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.895720Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:5bce3f11fe26b01b5633b943d5ca13a11460451da8c9187c84ff1168dacb04c9","observation_id":"25a5375b-e003-47f6-9baa-ed17c4240004","resolution":{"observed_at":"2026-08-04T14:44:13.895720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T14:44:14.374747Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.374747Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:4c1def3db4eaf118a84a7c5d1de08bbf3afe15ddaf67cc1c7e69e7266575a386","observation_id":"5584dfa7-3459-46be-a689-c1addf41cc4a","resolution":{"observed_at":"2026-08-04T14:44:14.374747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07787","last_updated":"2025-05-12T17:39:56Z","snapshot_observed_at":"2026-08-09T17:44:41.283579Z","submitted_at":"2025-05-12T17:39:56Z","title":"Learning from Peers in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07787","snapshot_observed_at":"2026-08-04T14:44:14.634746Z","title":"Learning from peers in reasoning models.arXiv preprint arXiv:2505.07787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.634746Z"},"links":{"cited_paper":"/paper/2505.07787","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:a7e8b78fe4b0c24cb19f2a8d960fb627efd4411fc6c9d9a656c9721fe2aa179b","observation_id":"c27b8e1e-b6de-48bb-b66c-bb51be424721","resolution":{"observed_at":"2026-08-04T14:44:14.634746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T14:44:15.364737Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.364737Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:371ec28724fbc2584d253225674c1e55c75d9a7cbb5cb9bfacd2f4bf4f6274be","observation_id":"8e1918c7-94ee-40ac-9f42-91e812559d95","resolution":{"observed_at":"2026-08-04T14:44:15.364737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T14:44:15.514854Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.514854Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:2edfbc387ab0230c5f470d4d01029c371f1722b046ff4ce414290ee7f3e18b09","observation_id":"20978142-4479-40fd-9c6a-255df20375c9","resolution":{"observed_at":"2026-08-04T14:44:15.514854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08852","last_updated":"2025-04-29T12:17:52Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:27:56Z","title":"Conformalized Interactive Imitation Learning: Handling Expert Shift and Intermittent Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08852","snapshot_observed_at":"2026-08-04T14:44:15.684741Z","title":"Conformalized interactive imitation learning: Handling expert shift and intermittent feedback.arXiv preprint arXiv:2410.08852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.684741Z"},"links":{"cited_paper":"/paper/2410.08852","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:79da9752b6bf53be343da0e63e3a1646e53cbfc3158d8e4db653ba0c45eb0958","observation_id":"94a462c1-b579-4624-9661-c2d3ac48cf7a","resolution":{"observed_at":"2026-08-04T14:44:15.684741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:44:15.804741Z","title":"expert_id","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.804741Z"},"links":{"citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:b09ab004e334c473037b6cd805646cb7e37efae90a83ab2b1073c87d7d4380f1","observation_id":"d43ee754-cc80-4702-8db6-99c0c8b8987a","resolution":{"observed_at":"2026-08-04T14:44:15.804741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-04T14:44:15.083396Z","title":"Kickstarting deep reinforcement learning.arXiv preprint arXiv:1803.03835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.083396Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:90e5e36a823d05bf9fa553116a5234eb45d2fccd71c67eedbba9c96204ae8310","observation_id":"1f63d06b-0b17-4988-93e5-828fe488091a","resolution":{"observed_at":"2026-08-04T14:44:15.083396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07181","last_updated":"2024-01-14T01:09:48Z","snapshot_observed_at":"2026-07-06T17:15:14.689584Z","submitted_at":"2024-01-14T01:09:48Z","title":"Reinforcement Learning from LLM Feedback to Counteract Goal Misgeneralization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07181","snapshot_observed_at":"2026-08-04T14:44:13.214742Z","title":"Reinforcement learning from llm feedback to counteract goal misgeneralization.arXiv preprint arXiv:2401.07181,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.214742Z"},"links":{"cited_paper":"/paper/2401.07181","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:7e1eece88d826765e26e9eb9755cba647052efaebcf12e685659c827e338d908","observation_id":"42c1ec05-700d-4cb7-896e-f6bbea0b035f","resolution":{"observed_at":"2026-08-04T14:44:13.214742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04692","last_updated":"2024-06-07T07:04:10Z","snapshot_observed_at":"2026-08-07T21:51:22.136369Z","submitted_at":"2024-06-07T07:04:10Z","title":"Mixture-of-Agents Enhances Large Language Model Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04692","snapshot_observed_at":"2026-08-04T14:44:15.199364Z","title":"Mixture-of-agents enhances large language model capabilities.arXiv preprint arXiv:2406.04692,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.199364Z"},"links":{"cited_paper":"/paper/2406.04692","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:d08dede8be3f38811ecb652383353973ea9f54072c65076b48d059ebb70699e9","observation_id":"85a9474b-8731-4776-94e3-93d4f31e777e","resolution":{"observed_at":"2026-08-04T14:44:15.199364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19409","last_updated":"2024-04-30T09:57:21Z","snapshot_observed_at":"2026-07-06T18:07:34.924208Z","submitted_at":"2024-04-30T09:57:21Z","title":"Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19409","snapshot_observed_at":"2026-08-04T14:44:14.954740Z","title":"Countering reward over-optimization in llm with demonstration-guided reinforcement learning.arXiv preprint arXiv:2404.19409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.954740Z"},"links":{"cited_paper":"/paper/2404.19409","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:46b00e2156defcf2b8a70da788480ce25ea87df1130af7ff1f659b4f07ad4797","observation_id":"b595ddec-1e1b-43db-a522-d74a07f306cf","resolution":{"observed_at":"2026-08-04T14:44:14.954740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-04T14:44:14.079997Z","title":"Training language models to self-correct via reinforcement learning, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.079997Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:74f687287721fa0c17a50e714817521022b9c3073280f17239bd5cb402168afa","observation_id":"ef26b841-6810-43db-a517-287c105c63db","resolution":{"observed_at":"2026-08-04T14:44:14.079997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-04T14:44:13.758213Z","title":"Critic: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.758213Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:ef86b658a643c2cd54b9048268d980623a54871d62b791302616f79a79cfdd7e","observation_id":"88d3d7c3-21f4-4525-8edf-18976e896cfc","resolution":{"observed_at":"2026-08-04T14:44:13.758213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01894","last_updated":"2025-04-14T10:25:47Z","snapshot_observed_at":"2026-07-06T19:44:43.248608Z","submitted_at":"2024-11-04T08:50:52Z","title":"Efficient Active Imitation Learning with Random Network Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01894","snapshot_observed_at":"2026-08-04T14:44:13.324744Z","title":"Efficient active imitation learning with random network distillation.arXiv preprint arXiv:2411.01894,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.324744Z"},"links":{"cited_paper":"/paper/2411.01894","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:0751c9897273d9b324778ad03591725db83eab8c835a2851d315ecb43c96a585","observation_id":"638047fa-cab6-415b-9a0d-e9249938123c","resolution":{"observed_at":"2026-08-04T14:44:13.324744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09782","last_updated":"2024-06-06T13:22:26Z","snapshot_observed_at":"2026-07-06T15:43:27.458645Z","submitted_at":"2023-06-16T11:37:15Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09782","snapshot_observed_at":"2026-08-04T14:44:14.782933Z","title":"Full parameter fine-tuning for large language models with limited resources.arXiv preprint arXiv:2306.09782,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.782933Z"},"links":{"cited_paper":"/paper/2306.09782","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:b4798f73e0c60bcbc1f637eb8b45e612eb90874c1ac72ee46725a27f4ccdfe9a","observation_id":"96ef28e7-a304-45d7-97b6-74c9564ba4ed","resolution":{"observed_at":"2026-08-04T14:44:14.782933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2509.23730."}