{"as_of":"2026-08-10T04:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67f90e105ffbff0166900e83bc1d17268082aae1d7169e0423c8af38a7393c5a","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:55:58.828795Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.18383/citation-record","integrity":"/paper/2510.18383/integrity","json":"/paper/2510.18383/citation-record.json","paper":"/paper/2510.18383"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.526698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.526698Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:3ff44fce05b0e6d59c5eb8cff8b598bb96ce1745ad1342d30c64f5f915453478","observation_id":"d1c81681-92eb-4117-89a7-bbedacdd9a62","resolution":{"observed_at":"2026-08-04T08:55:58.526698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.535363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.535363Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:cc1fcfeffed751bf4928b73f2431413156efd874f0531e373a0848d9c308bfbb","observation_id":"7693d82b-32ce-43c2-bdd1-894d3401f9c5","resolution":{"observed_at":"2026-08-04T08:55:58.535363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.541079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.541079Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:c57e9120e28a86687781403fd5832f2cc7a615a94b850c11d9ae4a0782bbe2c8","observation_id":"f9ba5fdc-0707-4b53-8eb9-388a0ed72549","resolution":{"observed_at":"2026-08-04T08:55:58.541079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-10T03:47:52.773511Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-04T08:55:58.545648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.545648Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:1549953dfcea6fe4da8a78531c16155383f949d7b6df36a663ce48cc5b0788b1","observation_id":"ae9ad3e8-a359-403d-b06a-4234b279a55d","resolution":{"observed_at":"2026-08-04T08:55:58.545648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-09T23:26:41.871607Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-04T08:55:58.550417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.550417Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:b7059b61f4035e43c96013d34abdadc57f8c8bb9a038bc280d441beb4e6c2d1d","observation_id":"3a280a8b-e968-43f2-8ec5-90bbbe690e94","resolution":{"observed_at":"2026-08-04T08:55:58.550417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.91","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"e66db5dc-6a9a-4e39-9bab-55bf9de38fe9","year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.555012Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:1e3e9870a3e037282833d945b35374b7a1573a8607f24834901f73c550e598f6","observation_id":"51ff5311-ae2a-4a5d-93d0-66f498b69373","resolution":{"observed_at":"2026-08-04T08:58:31.607089Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19737","last_updated":"2024-05-30T06:32:11Z","snapshot_observed_at":"2026-08-04T01:53:44.205351Z","submitted_at":"2024-05-30T06:32:11Z","title":"Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19737","snapshot_observed_at":"2026-08-04T08:55:58.560564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.560564Z"},"links":{"cited_paper":"/paper/2405.19737","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:347f9ae5369d69c30d6ca771b37c5c2cb75327479529d6ee15fb792304abe34a","observation_id":"e62b3e33-6608-4856-aca4-e8b3cb3ed20e","resolution":{"observed_at":"2026-08-04T08:55:58.560564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19842","last_updated":"2024-05-30T08:49:34Z","snapshot_observed_at":"2026-07-06T18:22:31.384923Z","submitted_at":"2024-05-30T08:49:34Z","title":"Improve Student's Reasoning Generalizability through Cascading Decomposed CoTs Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19842","snapshot_observed_at":"2026-08-04T08:55:58.565705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.565705Z"},"links":{"cited_paper":"/paper/2405.19842","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:64ff9235446e7f3d411fabc1f739f786c753a3aa03d31cb6f63bc6b2164367b8","observation_id":"b9a364c0-71d5-4bcd-bd89-994a3db68594","resolution":{"observed_at":"2026-08-04T08:55:58.565705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.571387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.571387Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d1e25c6eaee96b8518b1f444dd5b6084781c1c8baa351eb1fe4c0412ca541d36","observation_id":"ab00aba2-ed70-4162-8aa2-bed354f01d86","resolution":{"observed_at":"2026-08-04T08:55:58.571387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T08:55:58.576083Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.576083Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:c0c33d4e21e386c6c01402745e757ce9795090d2d6e7d9108a56a396d7afbfbb","observation_id":"78c4557a-f11c-4df4-84fd-6f0b44aa6948","resolution":{"observed_at":"2026-08-04T08:55:58.576083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T08:55:58.581084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.581084Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:6d65d530e56e5f4d809bca2f46df2ce0f20ce9ac9bd86b303d9495bb145b58ed","observation_id":"06dfca44-1c00-4d8c-8ece-9b7bb9ab5c00","resolution":{"observed_at":"2026-08-04T08:55:58.581084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.586028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.586028Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:7402b665abae145d374da9c73c6131a503415594e0ff7d0f194e858625cdc391","observation_id":"6d0f405e-d7cb-4edf-9bda-94929f10d04a","resolution":{"observed_at":"2026-08-04T08:55:58.586028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.590626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.590626Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:4281739bf1a97aebafee29571ef5cfa38ebcfc3ef78469feedc436e523c289d5","observation_id":"c5f29713-be10-40ec-a81b-63df1a9ee705","resolution":{"observed_at":"2026-08-04T08:55:58.590626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.594790Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.594790Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:7d1b35cbb2ae3d85f94e91dfefaa123242ad7317f5beec17bb015cd567842730","observation_id":"88eff210-0dae-457f-a4df-1ba9d3f35292","resolution":{"observed_at":"2026-08-04T08:55:58.594790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.599443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.599443Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:4adaf85b471b1c27236b85e8dd8f3aa2a0bf278eff1159aada9fc0d2d09dc628","observation_id":"1a1e5459-173e-4b5e-98d4-bdb91eaab672","resolution":{"observed_at":"2026-08-04T08:55:58.599443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.603979Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.603979Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:a00739440e9f2c4eb84e041a3856433edfafff72451a55593bca6b88450305d8","observation_id":"4f65d7d8-ec82-40b2-bc18-165f4449cfb3","resolution":{"observed_at":"2026-08-04T08:55:58.603979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T08:55:58.608828Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.608828Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:f00ff3623d53e33c10770dc6242d6dbeb010d6dd871dbda2145819fe3fd2ab2b","observation_id":"66f28734-ff82-493c-9852-ada0b102d42f","resolution":{"observed_at":"2026-08-04T08:55:58.608828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T08:55:58.613740Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.613740Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d9b4b9df4ed67dbeb6e10a2d13f6783146bfbf40ea6a1dad77bd5db40fc8e976","observation_id":"91a79947-b1bb-4788-9a65-e5b761eee3d8","resolution":{"observed_at":"2026-08-04T08:55:58.613740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-naacl.61","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"8399d671-88a0-42d2-ab08-67cce5db5efd","year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.618333Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:845b4b9b5291d08d3ead7461084ff81db575db81172a5923f4996db26b785156","observation_id":"bfb5ef7f-c2b7-41a1-939f-4bee2fcc24c9","resolution":{"observed_at":"2026-08-04T08:58:31.475304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.622595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.622595Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ec5709241a4f39eb97f72fede9431976fdc20d903176b0d45f05575768aecd71","observation_id":"86b95219-44b1-4b5e-a4a1-f06aa1cd01aa","resolution":{"observed_at":"2026-08-04T08:55:58.622595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.627305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.627305Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:4ba46402e0d3d61eb21c89ba300c97f41422cb4cb5632fba002b24dc91ea5e52","observation_id":"e12a4255-856c-46ad-9ef7-aa1dfb951425","resolution":{"observed_at":"2026-08-04T08:55:58.627305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.631650Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.631650Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:c6a926d74b617e8862276cfe84cbcf4d432c11fe6d344a48be8209c6a2dd7a9e","observation_id":"a10d9621-0cec-4a0c-b02f-7fef2fd5fa9e","resolution":{"observed_at":"2026-08-04T08:55:58.631650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.636359Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.636359Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:051af93d67dfb31f5f643883c8873d69bab0185a6a33dc5ca6a106e00ae719e0","observation_id":"13e726e7-bd7e-4547-b60a-e73d5bc20a16","resolution":{"observed_at":"2026-08-04T08:55:58.636359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.640766Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.640766Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d5195f54fca6b2eacf177e901b883868fa7923ede1e188595e054e3f5d968dfe","observation_id":"885a75a0-e6f2-4742-a896-1cbe0fb7836a","resolution":{"observed_at":"2026-08-04T08:55:58.640766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.645518Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.645518Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:b82785d237455e5a0262e1db7bc5b9dcc7db20b327e0bee52cd59019dc96e3e9","observation_id":"bd25fe70-e380-489c-bccd-b94365c42041","resolution":{"observed_at":"2026-08-04T08:55:58.645518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11315","last_updated":"2023-11-19T12:37:30Z","snapshot_observed_at":"2026-08-02T07:14:55.153336Z","submitted_at":"2023-11-19T12:37:30Z","title":"TPTU-v2: Boosting Task Planning and Tool Usage of Large Language Model-based Agents in Real-world Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11315","snapshot_observed_at":"2026-08-04T08:55:58.649949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.649949Z"},"links":{"cited_paper":"/paper/2311.11315","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:bf7cb5b41457de9becb968e0704ca73f887aa78b29e55ae96f7368f6e7f9993e","observation_id":"df2e4a58-1d23-4121-9910-792e8d416aca","resolution":{"observed_at":"2026-08-04T08:55:58.649949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-04T08:55:58.655096Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.655096Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e90394b7be783d43d1efa15c1706eafceb5678c3d6d58983503874ebe34166bf","observation_id":"35273487-6d54-4493-aa0e-a10989e94339","resolution":{"observed_at":"2026-08-04T08:55:58.655096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-08-09T18:38:39.510086Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-04T08:55:58.659542Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.659542Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:c63ff5eb74dee63b92c057605ed49b762426c07b13d5e5d862d4b57c0ef5a109","observation_id":"0887370a-54b9-4fdf-a4ac-577d9376f2f7","resolution":{"observed_at":"2026-08-04T08:55:58.659542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.663870Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.663870Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:65aefd18c6ef558e0e7fb4328697608c505160dd2bb53592976c14147fc2f4ff","observation_id":"cec7624a-c365-482a-b2d1-4d29979e5543","resolution":{"observed_at":"2026-08-04T08:55:58.663870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.668140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.668140Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:be63ff95d3b29d1af6fed3089d02e108fe4bce2623ee8af691d79b9c678d7c8e","observation_id":"cded21b1-dc0f-4f9d-811c-f2f35c3dd36d","resolution":{"observed_at":"2026-08-04T08:55:58.668140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.672391Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.672391Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:dc2a33744e24faaef03120625fb5c5436f286cbceadce35ba22136866c7b4fe8","observation_id":"5dafb6d8-5432-44d3-a103-d84ee6682cf7","resolution":{"observed_at":"2026-08-04T08:55:58.672391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05867","last_updated":"2025-02-09T12:06:10Z","snapshot_observed_at":"2026-08-08T17:34:25.001957Z","submitted_at":"2025-02-09T12:06:10Z","title":"Self-Training Large Language Models for Tool-Use Without Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05867","snapshot_observed_at":"2026-08-04T08:55:58.676999Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.676999Z"},"links":{"cited_paper":"/paper/2502.05867","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:f65c37156d1470a18d2618510d20bae59e8f840b6a075da15db71f4166a0af9e","observation_id":"fabb6a06-c309-4768-ad9b-bd27b5184468","resolution":{"observed_at":"2026-08-04T08:55:58.676999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14257","last_updated":"2026-07-23T12:32:53Z","snapshot_observed_at":"2026-08-05T11:19:48.609021Z","submitted_at":"2025-09-12T15:34:07Z","title":"Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.14257","snapshot_observed_at":"2026-08-04T08:55:58.681765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.681765Z"},"links":{"cited_paper":"/paper/2509.14257","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ba05a2b775c9e46e924c92889b0b56415383abcdcc786ba2ad8efd90a8429ae0","observation_id":"ffdab585-71ee-4ecd-a1da-ae45c1f93a2f","resolution":{"observed_at":"2026-08-04T08:55:58.681765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09014","last_updated":"2023-03-16T01:04:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T01:04:45Z","title":"ART: Automatic multi-step reasoning and tool-use for large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09014","snapshot_observed_at":"2026-08-04T08:55:58.686891Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.686891Z"},"links":{"cited_paper":"/paper/2303.09014","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:4b6f5427b460ad2004f7805258247fecf0efd2c2359c3a92d4288c7108b06923","observation_id":"201fa9f0-6e2f-4453-8b47-2cc69a32b1e2","resolution":{"observed_at":"2026-08-04T08:55:58.686891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.691802Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.691802Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:55f0a9e7a5130a1a74ce549a013f2720082b8cbc51f8e51453bc365e6719bc9a","observation_id":"fd611c45-4fb8-49cd-94ff-9913ed299b3d","resolution":{"observed_at":"2026-08-04T08:55:58.691802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.695844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.695844Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:68c1cf90fc9c003d7a1eee36f268c9b63f655c8d19941d9bfc44d5c0fdf61e9e","observation_id":"98bcafa2-19ea-44fe-a9b1-9445f531367f","resolution":{"observed_at":"2026-08-04T08:55:58.695844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-04T08:55:58.700248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.700248Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:1538d53312affad2d2faeceac9f81656556f1b340cbdf6c3968d915c3a2e3eec","observation_id":"f777e1f4-deb6-4a1b-ac92-a9911390a276","resolution":{"observed_at":"2026-08-04T08:55:58.700248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.48","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"6f290791-faaf-459e-9c2f-90f3feab468f","year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.704653Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:76fc5df32d059c4dbb93d3d92e4a0815df084382468409c3da55e2bfd7c4d5aa","observation_id":"85297bdb-f9cc-4c35-9eba-cd589a144fe9","resolution":{"observed_at":"2026-08-04T08:58:31.328348Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14728","last_updated":"2025-06-17T17:08:32Z","snapshot_observed_at":"2026-08-07T14:16:24.457276Z","submitted_at":"2025-06-17T17:08:32Z","title":"AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14728","snapshot_observed_at":"2026-08-04T08:55:58.708980Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.708980Z"},"links":{"cited_paper":"/paper/2506.14728","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:b5c2b5206571c5df282f0e7f584b90c9c23f7081d463c1cd831984246dcbc93b","observation_id":"b9cdfc19-79fd-438b-b499-37108b44385d","resolution":{"observed_at":"2026-08-04T08:55:58.708980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T08:55:58.714056Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.714056Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:5f094b65c97fa7099bc8b3ee4c8676503561bc32dd719290a7b8034b3222f9cb","observation_id":"089cc73e-f85b-4b94-bf57-132b84e3bfa3","resolution":{"observed_at":"2026-08-04T08:55:58.714056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.718525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.718525Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:41ee1ea93a80cacce8b1dedfad7319c2aaa2d02630cdc9a703f1c2f3cc30f503","observation_id":"47449036-6866-4c3c-a19f-36b622fcfe69","resolution":{"observed_at":"2026-08-04T08:55:58.718525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T08:55:58.723046Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.723046Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:b910df1544866b16331054fc54b4933519ffa8f7d4373fa7609f90c48c4ee881","observation_id":"e2ef7d70-0e40-4f26-9116-a9c59a73133d","resolution":{"observed_at":"2026-08-04T08:55:58.723046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T08:55:58.727453Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.727453Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:2a14d7772e3f8033b900a92c4b0293eee99ca18a618a1ddc9cb473b8d0b7859f","observation_id":"75cd815c-e27d-4a06-aaf1-a220052d98e1","resolution":{"observed_at":"2026-08-04T08:55:58.727453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T08:55:58.731703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.731703Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:3795de6c0529c80ed441980dd449c9cb64b1185659f4dfb85feaf66796ca4dfc","observation_id":"5a5a4ddc-a842-4a66-a217-915d49281ec4","resolution":{"observed_at":"2026-08-04T08:55:58.731703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-05T20:36:54.358831Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-04T08:55:58.736344Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.736344Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:9bbd10a57125b6da5428444f725ff6f8d8575c9e16703dc3d91048880ae1c9f4","observation_id":"1322423a-7eab-4316-aea0-00406cad06da","resolution":{"observed_at":"2026-08-04T08:55:58.736344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.742622Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.742622Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:c407cc38dee462f5672e51533ab675e2017d7ccb9ce5c352a16c88e63b3be4d4","observation_id":"dddb4053-77f6-4175-a9d6-ddfc9c3e9225","resolution":{"observed_at":"2026-08-04T08:55:58.742622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.748285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.748285Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:651fca771b8f1ce45fa427b2789cf43819f2909eccd62e7750243ebaa0b4e012","observation_id":"6c975a41-de88-4417-bf60-f0799217a7b2","resolution":{"observed_at":"2026-08-04T08:55:58.748285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.753379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.753379Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:20d3d04ef665751a2f971d56edfcfcb3d255e42d911331563e29ba0dc4e729ee","observation_id":"396fc1c9-0ffc-4426-ba37-44953ac2cd76","resolution":{"observed_at":"2026-08-04T08:55:58.753379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.759048Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.759048Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:1ea271f67fe271d29be22224c18a28b52d4f7a0d65ebf2ca321d9d96ea3ef6d3","observation_id":"f0b8dce6-0f88-4b52-9bdf-ea5a78b62e7e","resolution":{"observed_at":"2026-08-04T08:55:58.759048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-04T08:55:58.764014Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.764014Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:59055aaaed595147ec3bb41f3f270343aabd02f94efe5094c751c0e2246ab61a","observation_id":"0b3542fc-b4e1-4aac-9db5-679251a413c3","resolution":{"observed_at":"2026-08-04T08:55:58.764014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.769104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.769104Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:20771bd6cf8a5913e6f55d1969c82ee016f258cca4be3c8f98d644a5f9996a35","observation_id":"a7766cf9-99d0-4e62-9840-c8c132c5ee7d","resolution":{"observed_at":"2026-08-04T08:55:58.769104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-09T13:10:58.433740Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T08:55:58.773353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.773353Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:34e004a4d2ce5af12a552dc4cd2cd594284e3c38b7cf1850f308c295d3019852","observation_id":"67b20b37-35a5-48b2-8b64-50cd07d52306","resolution":{"observed_at":"2026-08-04T08:55:58.773353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-04T08:55:58.778667Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.778667Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:11527472931a3fe93a1fcd94bf0c8c4ac019c2cd0dc0c9e2f0a107013477c35d","observation_id":"17c3d065-b494-448f-80f4-4c536249bf21","resolution":{"observed_at":"2026-08-04T08:55:58.778667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.783361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.783361Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:5e388ac1aed438dcc54e8c693c33849e12a0d983e595d9d9a2f598ef3cf97b5c","observation_id":"841bf8cc-6af8-4b60-8016-70f2a88d3ed2","resolution":{"observed_at":"2026-08-04T08:55:58.783361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.787754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.787754Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:8d8f966c983b7a6aefb85ca83116e8170d1508dd44971215d9889e86de20a27b","observation_id":"328dc584-3583-4338-abc1-416eebd8a8e6","resolution":{"observed_at":"2026-08-04T08:55:58.787754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11176","last_updated":"2024-09-24T10:01:31Z","snapshot_observed_at":"2026-08-01T17:35:58.677762Z","submitted_at":"2024-06-17T03:29:13Z","title":"Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11176","snapshot_observed_at":"2026-08-04T08:55:58.792516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.792516Z"},"links":{"cited_paper":"/paper/2406.11176","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:a7ec6b7ac339c93d1e0b47e7e7813760dd9d27c55e07d319b2af0d92073d73bb","observation_id":"e141f2e5-c99d-43d4-acb4-8e21cc1a7426","resolution":{"observed_at":"2026-08-04T08:55:58.792516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-04T08:55:58.797104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.797104Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:869b60b08ef7a590b169876be1860b0a777c385f09e57a9d0e37fbc97f1861fe","observation_id":"b751338d-3cd5-4acd-bc02-e6e0f32cdaea","resolution":{"observed_at":"2026-08-04T08:55:58.797104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.801782Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.801782Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:8b93d01c5640c4ce9c0bb954f1965980051b23fd102d6da489681c22d35a304a","observation_id":"9c90dc37-7a59-47ed-8c5d-92c2af116d4e","resolution":{"observed_at":"2026-08-04T08:55:58.801782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.806320Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.806320Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:259fd5b49e92a4b6126b9cbaa51fa6f4618650d49648998028bd97e61cce1021","observation_id":"938722f6-172b-4831-a5cb-e2a032a2be7e","resolution":{"observed_at":"2026-08-04T08:55:58.806320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09804","last_updated":"2025-01-16T19:23:11Z","snapshot_observed_at":"2026-08-06T11:51:00.192063Z","submitted_at":"2025-01-16T19:23:11Z","title":"Enhancing Generalization in Chain of Thought Reasoning for Smaller Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09804","snapshot_observed_at":"2026-08-04T08:55:58.810427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.810427Z"},"links":{"cited_paper":"/paper/2501.09804","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:9658a5d3adf1bfc710d357df9b7979a3ca9f1ed2fe96719f0ab30c4caec357cd","observation_id":"8482faed-1636-4af1-af6b-96c5074befa2","resolution":{"observed_at":"2026-08-04T08:55:58.810427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07745","last_updated":"2025-08-17T06:06:35Z","snapshot_observed_at":"2026-08-07T20:27:58.381861Z","submitted_at":"2024-10-10T09:23:26Z","title":"StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07745","snapshot_observed_at":"2026-08-04T08:55:58.814994Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.814994Z"},"links":{"cited_paper":"/paper/2410.07745","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:83c6b20403647e17e1f1992b6862399b32b00198542fd5a68b45836191d0a6cd","observation_id":"8f878ced-d3f7-4122-9056-02d59d5cf58d","resolution":{"observed_at":"2026-08-04T08:55:58.814994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07921","last_updated":"2023-08-15T17:58:45Z","snapshot_observed_at":"2026-08-08T02:31:17.924386Z","submitted_at":"2023-08-15T17:58:45Z","title":"Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07921","snapshot_observed_at":"2026-08-04T08:55:58.819366Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.819366Z"},"links":{"cited_paper":"/paper/2308.07921","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ee36f7034c6a69efe2d3f8df48d509a9801b4c63c93eeaa8910a48be88998545","observation_id":"4fc9fc3a-9ae6-4abc-bdbe-ebe7479750bb","resolution":{"observed_at":"2026-08-04T08:55:58.819366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.823939Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.823939Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:a7ce6eccd94f56fef98e3d036b149be1076622ee02c77d4cf459e4c130cf7dd8","observation_id":"f2b889f0-a615-4ec7-bbee-c4037a817e9f","resolution":{"observed_at":"2026-08-04T08:55:58.823939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.828795Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.828795Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ed10060a48dd4b6687163393a6a47b650e5043763340458a0c2921152e9faafb","observation_id":"84aa8d46-0ee5-40d7-8d82-4d16aa04f921","resolution":{"observed_at":"2026-08-04T08:55:58.828795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2510.18383."}