{"as_of":"2026-08-22T12:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01e9a6d4c571a9197c3d9d43140db397d605c20209d04ffb7cff039b0d171511","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:51:43.368701Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12764/citation-record","integrity":"/paper/2608.12764/integrity","json":"/paper/2608.12764/citation-record.json","paper":"/paper/2608.12764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:44.047372Z","title":"Glm-4.6.https://docs.z.ai/guides/llm/glm-4.6, 2025","venue":null,"work_id":"7635cb11-00f7-42c8-a0da-b0aa1ae5f696","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.161572Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:8a022155417123a9e6ffab08dd22c37d470b1cb97a027659d11a4508a220dc07","observation_id":"548ae55b-55e2-41eb-954d-b76e5e591933","resolution":{"observed_at":"2026-08-15T23:51:44.050035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:44.039080Z","title":"Glm-5.1.https://docs.z.ai/guides/llm/glm-5.1, 2026","venue":null,"work_id":"eee871d2-08d0-4326-b6ff-f984a646b81b","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.164991Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b78a4ed2fb192750a43d11447cb1680b05c5360027f012660f6351022a9ffe80","observation_id":"c1e85063-e048-44c7-b5a2-a1c149ddbf0a","resolution":{"observed_at":"2026-08-15T23:51:44.042037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:44.030927Z","title":"Introducing Claude 4 — anthropic.com","venue":null,"work_id":"e4c6ad49-eda7-46d1-8187-0a14b4d13369","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.167930Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b454589aeb11c5db4a5590a6515ff4e14a12016ae3c7ce8f9b759c73ff352a2a","observation_id":"9ed6c33b-fb1f-40be-93b9-0ba7e7fc2e4f","resolution":{"observed_at":"2026-08-15T23:51:44.033676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:44.022614Z","title":"Introducing claude opus 4.7","venue":null,"work_id":"8ad19e53-eb4b-4ce3-81dd-57eb11e6f340","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.171598Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:a60ead988ea98b931e4e95dc2d62a0af9e53a64ea03c3da1653601a2f44109da","observation_id":"dd43c5cd-cd67-4d67-8ec2-b4b3ee26c669","resolution":{"observed_at":"2026-08-15T23:51:44.025747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:44.013858Z","title":"Is gpt-oss good? a comprehensive evaluation of openai’s latest open source models, 2025","venue":null,"work_id":"9d1f9e6e-04d2-48a3-a3fa-8e6f2493c0c4","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.174610Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:0d12cee906a5f78f46b34f595f3d23fbdaf17ce1830cd9421302f3213a5a2dfa","observation_id":"61ac298d-1de2-46b8-80eb-5bac227bbd23","resolution":{"observed_at":"2026-08-15T23:51:44.017417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:44.005484Z","title":"SFT memorizes, RL generalizes","venue":null,"work_id":"b1f5eb09-e36f-4d35-b53d-a737edf9a75d","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.177631Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:1c2bf8c236193d500612538a91c6cc152cb0e2b0831714e33a8315e714d4943b","observation_id":"c25e1169-fde7-4057-85bb-fbf7c94c7f7d","resolution":{"observed_at":"2026-08-15T23:51:44.008434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.996403Z","title":"Gemini 3.1 pro: Best for complex tasks and bringing creative concepts to life.https://deepmind.google/models/gemini/pro/, 2026","venue":null,"work_id":"ce875492-aecf-49d9-9d04-0512a3713e52","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.180525Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:f47ecf152f4402b9d316142b23ec9dc96ecde8575f5df81f3b20f7c831cc5ada","observation_id":"418d6d98-af6d-414e-bdaa-a607bb5b60bd","resolution":{"observed_at":"2026-08-15T23:51:43.999583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.183156Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.183156Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:20f043c5da60aff17ec58feaa07ea0bc0fba063741be1772db55d9740ca32a6e","observation_id":"ffdab16d-2070-416f-ba54-76c838ebfb19","resolution":{"observed_at":"2026-08-15T23:51:43.183156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.981967Z","title":"Deepseek-v3.2: Pushing the frontier of open large language models, 2025","venue":null,"work_id":"72172814-5058-4cc2-8301-9cecc8d5d8bc","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.185839Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:f885a93cb3f139b1d0c4afde0b1fa23beb57325fb9ba4fef00410ec20b726ed4","observation_id":"6345e824-41d7-403e-8924-25c31cd738c2","resolution":{"observed_at":"2026-08-15T23:51:43.985774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.972787Z","title":"Openthoughts: Data recipes for reasoning models, 2025","venue":null,"work_id":"0bb82372-9309-4c61-92ca-ef327f13c26c","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.189463Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:93966517ab2925fed6e40596435f20c04d5b1e556e8c0b2a856e0ba77777b6cb","observation_id":"83d43f61-deb0-4545-aa73-af2292a24da3","resolution":{"observed_at":"2026-08-15T23:51:43.976138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.961858Z","title":null,"venue":null,"work_id":"94b14fc5-64e8-449f-bc1b-2e5f780da05b","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.191958Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b0daf1c2f4e5f126c69b0bc238240cbe78abf7ec9eb3a6cb175843cbb29e3311","observation_id":"ff42beca-82c0-4741-b8d7-724ef4aea5cd","resolution":{"observed_at":"2026-08-15T23:51:43.965115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.194617Z","title":"Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.194617Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:bb046b6d89cf5e4880ac044eba2f2c499538b65bcddbe4bbea75cbbd876d315e","observation_id":"2904fb17-06de-41a6-a14e-4fa7bd5933af","resolution":{"observed_at":"2026-08-15T23:51:43.194617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-15T23:51:43.197480Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.197480Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:6b5a6c37beb8bec5f3f94f67840cb7da242c8076032e21cc03084094040bec59","observation_id":"cf34c1f6-2774-42bd-9aa3-68e0632b0f3c","resolution":{"observed_at":"2026-08-15T23:51:43.197480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-15T23:51:43.200350Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents.arXiv preprint arXiv:2505.15117, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.200350Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:bed6db84e60f1229a0d53f2172f14c52efb80832eb01bf34079254be92aa09b1","observation_id":"bbcfe5a8-7c4d-4729-bd5c-0faf5bb04904","resolution":{"observed_at":"2026-08-15T23:51:43.200350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-15T23:51:43.203767Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.203767Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:f128f4032049df359901ecf870f8dfcd65417c5faf44a5adf0059391fc965e27","observation_id":"97fbe675-2bfe-49eb-9b8a-d2e9faf3e251","resolution":{"observed_at":"2026-08-15T23:51:43.203767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.943559Z","title":"Fact, fetch, and reason: A unified evaluation of retrieval-augmented generation, 2024","venue":null,"work_id":"1fc97994-f667-49a4-910a-2873fc57e50d","year":2024},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.206665Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:961361ba215978dab5bafc5634e294ac994ff8efb61529d29382cfd3178bc995","observation_id":"92f2cbd0-5407-4c46-816c-332d28b43ff2","resolution":{"observed_at":"2026-08-15T23:51:43.947758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.209595Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.209595Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:175e330dfc3b75629d2876ec7b110f63207094058f60aa8190a3baa422d7b61d","observation_id":"f05af0a4-9eb9-41e7-bfb8-5d88a1596e67","resolution":{"observed_at":"2026-08-15T23:51:43.209595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.927823Z","title":"The tool decathlon: Benchmarking language agents for diverse, realistic, and long-horizon task execution, 2026","venue":null,"work_id":"16423b14-4306-4e13-9ac5-63b2e223383b","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.213232Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:95fea15617f2c1d1a071bdaf6f472b07f907ee13667eb0819c77b294b3e10b99","observation_id":"e4e0c641-23b8-482d-9d52-34c178b8b2c5","resolution":{"observed_at":"2026-08-15T23:51:43.930895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.919241Z","title":"Websailor-v2: Bridging the chasm to proprietary agents via synthetic data and scalable reinforcement learning, 2025","venue":null,"work_id":"393ff7d4-c9d5-460d-b448-23368943be5e","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.216094Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:128b2e7388ea6e7e2bc9e512458a54bea95e1461f40ae0db60fbaa26c798d325","observation_id":"a140c354-1a2d-4ab6-b8f4-a0801f3f26f2","resolution":{"observed_at":"2026-08-15T23:51:43.922352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.910480Z","title":"Websailor: Navigating super-human reasoning for web agent, 2025","venue":null,"work_id":"840a77ab-6b27-4507-bc37-8454c2086556","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.218917Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:1cd1543fbe2a4acdda27c5be7c15f4d9177b2384f9625425818768ca7c6d3c3c","observation_id":"1b758483-8e39-456d-af58-47c56d82d287","resolution":{"observed_at":"2026-08-15T23:51:43.913604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.900897Z","title":"Chain-of-agents: End-to-end agent foundation models via multi-agent distillation and agentic rl, 2025","venue":null,"work_id":"05412732-c795-412a-a0aa-8e9ce68c7287","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.221863Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:dd2445b7079be085d34254b367e8ce08f675c9a853a2f46ab5b98945e4352e77","observation_id":"8a65a022-0282-4aa2-a37a-067dcfa28e0f","resolution":{"observed_at":"2026-08-15T23:51:43.904459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.890620Z","title":"Webthinker: Empowering large reasoning models with deep research capability, 2025","venue":null,"work_id":"44adb2f6-bf79-4e1b-8784-f49d7eee11b1","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.224555Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:df6e49e9406cb9c5c39f2b466c2babebea18c6da8b3d5acd809593211f3df4a9","observation_id":"d7383d2c-d8df-4543-ad74-e1e76aa73a4a","resolution":{"observed_at":"2026-08-15T23:51:43.894115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-15T23:51:43.227221Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.227221Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:1fa5bb4a03c9eb81267fdd824eb460d3fd3471ae936e6fd38e19b8e36ceb1fed","observation_id":"ee6b7ef5-bd7e-4eaa-b120-b617099f344a","resolution":{"observed_at":"2026-08-15T23:51:43.227221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.230442Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.230442Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:a5da7dc205c3a7cd695b96044761050ffe022f9b52fae87dd1a77cb7a6b87975","observation_id":"d4bf8ac0-7843-4c0e-87d0-d91b7edf8f46","resolution":{"observed_at":"2026-08-15T23:51:43.230442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.233345Z","title":"Synlogic: Synthesizing verifiable reasoning data at scale for learning logical reasoning and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.233345Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:4a647c48dedb5c55545dc5d4b133510b47e5edd30f897cc3a68a767ef7d63422","observation_id":"d2e772a2-db15-4381-a0e3-384c9ba65cdd","resolution":{"observed_at":"2026-08-15T23:51:43.233345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.867907Z","title":"Webexplorer: Explore and evolve for training long-horizon web agents, 2025","venue":null,"work_id":"6ae42def-00e8-4fc0-9d82-f20e67cee093","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.236115Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:2185ef186507df3d460072cbefab881367d804c60782632d2e9e18ca46939e97","observation_id":"ddeb2804-c677-44c9-a553-71645a4bf174","resolution":{"observed_at":"2026-08-15T23:51:43.871231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.238860Z","title":"On-policy distillation.Thinking Machines Lab: Connec- tionism, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.238860Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:7df5deea6a961b77a7118322875ea34370fc83a8e229d24ddb2a3bb0fbb5e76d","observation_id":"efd09cfe-6597-4652-a0fc-febcdad64339","resolution":{"observed_at":"2026-08-15T23:51:43.238860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.853264Z","title":"Deepdive: Advancing deep search agents with knowledge graphs and multi-turn rl, 2025","venue":null,"work_id":"e296e9ec-cbb1-4004-b788-e44223c8dd18","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.242571Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:58f1242d30f81cd3e5abc432c898ca5c4d1c2078a3a6b113b7e4578cbda05819","observation_id":"67d044b7-5e1d-4cfe-80b8-677198465c45","resolution":{"observed_at":"2026-08-15T23:51:43.856509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.246253Z","title":"Gaia: a benchmark for general ai assistants, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.246253Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:0067bbb652f769d395ac9e009ddb902180b94580c2447ba0f18ded38742bc330","observation_id":"14420623-eb4a-42d0-b418-dee0e3931b24","resolution":{"observed_at":"2026-08-15T23:51:43.246253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.839892Z","title":"Minimax m2.7: Early echoes of self-evolution, 2026","venue":null,"work_id":"a3e27f42-3703-497b-9627-775bddb6885e","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.249288Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:6bb10fd22092ef7991c65d98154b4dd761af6fcbadaee767764b85b4391a4502","observation_id":"0e369d84-6b97-4c31-b204-86d92bc8f893","resolution":{"observed_at":"2026-08-15T23:51:43.842820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.831570Z","title":"Gpt-5-nano","venue":null,"work_id":"61e00ba3-683c-42bd-bfb4-b5bb02894c5a","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.252043Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:d781912f0ef5cca2e240979bc5359ec01b99f8b704596d874887afb7b2f1d593","observation_id":"b4d8224f-499a-4c67-a16d-4c557279332b","resolution":{"observed_at":"2026-08-15T23:51:43.834397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.822282Z","title":"Introducing gpt-oss","venue":null,"work_id":"a8681156-d115-44f8-9c77-2f60614f21c5","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.254662Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:f45d105224e5ec439e40401fb70f58732bfa55359d203a41151a130a6e056300","observation_id":"1b80dfb7-199c-4a0d-8cb6-d9cb74fe7f51","resolution":{"observed_at":"2026-08-15T23:51:43.826063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.814127Z","title":"Introducing gpt -5.5","venue":null,"work_id":"9829d37c-c1ad-41dc-8703-724ad6c3b87f","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.257321Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:1451749a0c7316f8560ee20e794c87dc81bd181c8ca27f5153d5bee93a40fd64","observation_id":"c7a3c941-fbae-4ded-854e-614078dc060d","resolution":{"observed_at":"2026-08-15T23:51:43.816936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.260011Z","title":"Qwen3.6-Plus: Towards real world agents, April 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.260011Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:f051d92f1bd730aeb4e753329bcff26ceaf83365a179f47e7b592e6c7bdb8518","observation_id":"57bd4ec2-cd31-4f68-b75c-2c7bf272849f","resolution":{"observed_at":"2026-08-15T23:51:43.260011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.801234Z","title":"Crisp: Compressed reasoning via iterative self-policy distillation, 2026","venue":null,"work_id":"b8cf57a3-478b-4fd4-970d-32745a44a957","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.262642Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:3240418358579ac0beb678b04b29cd35e08978d90149979f09c861a1814ba2fc","observation_id":"6a18700d-d4b5-4446-b0bf-2a88035e295b","resolution":{"observed_at":"2026-08-15T23:51:43.804533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.792345Z","title":"Generalization in generation: A closer look at exposure bias","venue":null,"work_id":"1e3b7163-733e-4c93-8129-87117298dde5","year":2019},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.265300Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:ebd0da310b720b07605707927e8acd3ee1fc4194861a9e46aa625ba84516a944","observation_id":"4c5b4d03-3257-41e3-9e70-c77e4a31c06a","resolution":{"observed_at":"2026-08-15T23:51:43.795590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.268137Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.268137Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b0912075b26dc78070967d6bd6b2ae550122478d56a6267eb1db04e7fafb4a35","observation_id":"4cf2727c-0a05-4416-914f-0597dda75701","resolution":{"observed_at":"2026-08-15T23:51:43.268137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.270828Z","title":"Self-distillation enables continual learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.270828Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:da77e1e5514c7eafbc54270c4ff64b0b5138aca67da1c3e31ff4fd223ef22c9a","observation_id":"f54d5f89-7ecc-4ad0-bb98-e67927e0f891","resolution":{"observed_at":"2026-08-15T23:51:43.270828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.773680Z","title":"A survey of on-policy distillation for large language models, 2026","venue":null,"work_id":"c443cead-4c10-4437-98f3-be64dbba86f8","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.273666Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:bb46f10827deaae6aa765364817dd13db43908960a162d31a701587b25e75c24","observation_id":"b310cec0-6933-4c75-9c8a-faa11b68b926","resolution":{"observed_at":"2026-08-15T23:51:43.776760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.765104Z","title":"Webshaper: Agentically data synthesizing via information-seeking formalization, 2025","venue":null,"work_id":"6606b5a3-4360-4fee-802a-91200958dc42","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.276194Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:6e8a9a61353ff6a35f58f027c53f279744170ad03940051cfcd4b1c65cae9eb2","observation_id":"83067a0b-77ad-4284-bc08-cb3c031d2576","resolution":{"observed_at":"2026-08-15T23:51:43.768299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.757104Z","title":"Kimi k2.6: Advancing open-source coding","venue":null,"work_id":"9323c1b6-c780-472f-8299-e8a701fce898","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.278666Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:730836ef5429840bcf8353895e09ba522f92fb852acf2786fdb5f2390281b371","observation_id":"9558d3d7-cf9a-4498-a7cc-94240f65c2e3","resolution":{"observed_at":"2026-08-15T23:51:43.760182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.11793","last_updated":"2026-04-21T16:02:11Z","snapshot_observed_at":"2026-08-14T05:17:40.668746Z","submitted_at":"2025-11-14T18:52:07Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.11793","snapshot_observed_at":"2026-08-15T23:51:43.281315Z","title":"Mirothinker: Pushing the performance boundaries of open-source research agents via model, context, and interactive scaling.arXiv preprint arXiv:2511.11793, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.281315Z"},"links":{"cited_paper":"/paper/2511.11793","citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:275b15687ba7a6ad329d5053bc0b7009a2c901aa1368e8c11b2f0b0c8e46694b","observation_id":"3c517d4d-a00d-4422-8f88-bc637c8986c4","resolution":{"observed_at":"2026-08-15T23:51:43.281315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.284154Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.284154Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:11ee70c9507bf01da242f63a079a75ac9c8ab6ef6edd4ba88d1f18fdece23ffa","observation_id":"8a772cdf-7424-4a82-accf-872f59ca70a2","resolution":{"observed_at":"2026-08-15T23:51:43.284154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.286776Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.286776Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:d7339e8b36ddebbeb015bf6ca7b3882c20eaf47d5fb5b57855b71391ccd29104","observation_id":"4788aa76-868c-4c01-bf0f-2843fee84807","resolution":{"observed_at":"2026-08-15T23:51:43.286776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.739639Z","title":"Smartsearch: Process reward-guided query refinement for search agents, 2026","venue":null,"work_id":"dbf1a7f4-3c5c-45d1-a741-e65c9e8a2cc8","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.289651Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:1513ebbea1d72e7685cc369210e6ae0f3370f887150a19c6bdafb21512337df5","observation_id":"29ff97a0-2086-4e2b-9d1e-c04652128481","resolution":{"observed_at":"2026-08-15T23:51:43.742516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.731635Z","title":"Mirage or method? how model-task alignment induces divergent rl conclusions, 2025","venue":null,"work_id":"991952c6-3d8c-44df-b4c6-1a0f1fa9781f","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.292212Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:0d2b38ef2baf1145867a32c4204a33f0f05ea26fad9fc6762336a4bb9b05a78c","observation_id":"191dff8d-fe0f-433c-9749-f9147ab6ad48","resolution":{"observed_at":"2026-08-15T23:51:43.734668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.723113Z","title":"Recode: Updating code api knowledge with reinforcement learning, 2025","venue":null,"work_id":"e9afdd5d-b94a-4211-a5d0-47859a9bce16","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.294878Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:f7dac236c7d9aaf6aa3a92ff28f39b06d65e50a5184f0a5a47d617f11be3372e","observation_id":"8005269b-060e-43ba-82d3-6734b9123600","resolution":{"observed_at":"2026-08-15T23:51:43.726062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.715056Z","title":"On the generalization of sft: A reinforcement learning perspective with reward rectification, 2026","venue":null,"work_id":"ae609372-90b4-48a9-92ed-aa5d0a28c923","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.297524Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:6df5e0ee6a68eda6d8e380cb4e13c56f80eb1af63341916da1e7d408cf1b8d2a","observation_id":"c6938df4-51c4-4d03-94bd-24fb7aaad3fc","resolution":{"observed_at":"2026-08-15T23:51:43.718023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.706914Z","title":"Grok 4.1 fast and agent tools api.https://x.ai/news/grok-4-1-fast, 2025","venue":null,"work_id":"86fa0f6d-33ee-4185-9521-c7ac39f39b93","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.300110Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:73122827f9074682c8c4ce401510bbfda8fb960ab4c8c85e1ad5915f946b65ea","observation_id":"4f3c1a6e-fe1b-4e02-9fb5-1422126c4526","resolution":{"observed_at":"2026-08-15T23:51:43.709829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.302629Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.302629Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:ebab9934632c05e22b6e1529ecf4fff4800424ea066dc64a97a71ae0437be828","observation_id":"8f6fd0bb-f01d-4ffc-8a13-8bae0310a77d","resolution":{"observed_at":"2026-08-15T23:51:43.302629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.693997Z","title":"Principle process reward for search agents, 2026","venue":null,"work_id":"f4af0a5c-b033-4978-990d-9f02405d88dd","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.305487Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:fafa2e9c4e89bca978ba3d19b1d27bf87ecebcd1e3e9dbbef5194eb1d9904e5a","observation_id":"f3271436-d47e-4138-85c1-e3730eee63c4","resolution":{"observed_at":"2026-08-15T23:51:43.696941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.685639Z","title":"Tip: Token importance in on-policy distillation, 2026","venue":null,"work_id":"465bdec8-6df5-4a5f-8b7c-1aa5c9b470c5","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.308274Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b76b5e82e554d77a46658d3d54625ae809ccd164104d4cd79fcb2a65025321e4","observation_id":"12da9215-0b9a-420e-a5d5-b714f08c0a3f","resolution":{"observed_at":"2026-08-15T23:51:43.688894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.677738Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":"14e01387-db03-4e14-be81-0be167f5cca5","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.311087Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:55827f17d37d29a1b5d28f2c68f7fa1ecd9883796d225a36392b1ffe52c0f469","observation_id":"42f2809f-408f-4a3b-9531-c6ea05356dee","resolution":{"observed_at":"2026-08-15T23:51:43.680631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.313743Z","title":"Self-distilled rlvr, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.313743Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:20c5a6b9e6c2411f137d5a3451db56726186dc1c432995f6e8c5017563e7688f","observation_id":"312d3551-dfb5-4e9a-9e0d-4382c12354ac","resolution":{"observed_at":"2026-08-15T23:51:43.313743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.316248Z","title":"Cohen, Ruslan Salakhut- dinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.316248Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b0f75225e3834d0c64a4c9600673670a2ea04cdc604d909b4645d92636616a36","observation_id":"35d6e048-4992-48ca-a0d3-0e0bc682f0b5","resolution":{"observed_at":"2026-08-15T23:51:43.316248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.318984Z","title":"React: Synergizing reasoning and acting in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.318984Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:231edcdea905bccda16e9d1f44fc4f68a5babfc9eea219bc1a6431421e835744","observation_id":"d742c681-1544-463c-a09f-331a18f4816b","resolution":{"observed_at":"2026-08-15T23:51:43.318984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.321940Z","title":"On-policy context distillation for language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.321940Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:c3c41d56323a5f72fad1ba0ae2526c61aa7e5d945cc933f3df4f33a58c427084","observation_id":"840f85e9-87c7-4670-86a4-15b0d5d55b88","resolution":{"observed_at":"2026-08-15T23:51:43.321940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.324449Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.324449Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:52de9d6f32546ca9fb317a026ec05a7b9412602dc8deafeace55ba04058ce9e8","observation_id":"e179a6bd-ed91-47fb-8320-b9a32f1fb84b","resolution":{"observed_at":"2026-08-15T23:51:43.324449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.646901Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":"c37d515b-f7bb-4a56-8922-b6381df67e92","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.326932Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:ab90bf20042380c236dd3a7e34da78e6cb38dccf197ecd7baf72ededf69a48ba","observation_id":"eba60e96-0f9f-486a-90bd-0fb221ce7f8a","resolution":{"observed_at":"2026-08-15T23:51:43.649857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.637301Z","title":"The landscape of agentic reinforcement learning for LLMs: A survey.Transactions on Machine Learning Research,","venue":null,"work_id":"d180b5d4-c5a0-4047-a5f7-006dbbfcf8bc","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.329537Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:276b706ab65c1007aa5c5a78a33ba370ba013553f2d9bc74523fa8c2ab146996","observation_id":"1847a17f-81e8-46b7-a374-781a1ebd4558","resolution":{"observed_at":"2026-08-15T23:51:43.640876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.624145Z","title":"Tool-r1: Sample-efficient reinforcement learning for agentic tool use, 2025","venue":null,"work_id":"c5ec94fa-314f-4855-a006-fe232ffd1768","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.335666Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:e69b0fdeb2bb87b01d7149a196f9f6ff02870b0473a4d7bad267ad86f6d34f4c","observation_id":"625fdb2f-a8e4-489a-8087-d9f3ab320c85","resolution":{"observed_at":"2026-08-15T23:51:43.627760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.614319Z","title":"Criticsearch: Fine-grained credit assignment for search agents via a retrospective critic, 2025","venue":null,"work_id":"64f7169b-8239-41c4-8f6b-095241cd6242","year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.338362Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:9485f57e429252c8e00147d29d25a7c57246b65f88650f5b825e1727ce3066bd","observation_id":"8eb1cad7-5bfc-4ba1-bb2d-71eb96edfe97","resolution":{"observed_at":"2026-08-15T23:51:43.618413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.340966Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.340966Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:be97d101a4636046cb82075d5b5e07dfe74dc6ae1f70a894dac392224980f028","observation_id":"5569005a-0110-47dc-accd-32fd96bfa726","resolution":{"observed_at":"2026-08-15T23:51:43.340966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.600300Z","title":"aha moments","venue":null,"work_id":"aa5c5254-c1a7-48c8-9ebf-7621b692307e","year":2026},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.343631Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:b7862f54c0e65f91454eb14436bad3dd3a2264ac0b99f97ec38fd95fadff2474","observation_id":"375f757c-d9e1-4c0b-b105-7a844f775214","resolution":{"observed_at":"2026-08-15T23:51:43.603372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.592369Z","title":null,"venue":null,"work_id":"0538a4a2-9565-4d92-ae6e-c0ff599106d7","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.346793Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:d1ae20c3175f2a744977d15a4f6612d6212085ab14429d98f889363589ce5120","observation_id":"895914a5-9a82-4a58-901a-763b5af889fa","resolution":{"observed_at":"2026-08-15T23:51:43.595159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.583686Z","title":null,"venue":null,"work_id":"f348524f-74fa-4f8b-af80-47114fd6fee4","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.349454Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:9a9a589517ec2a1f83b4ffead4aea52bad5dc2d6cb5374a3ebc172eb70ab1f65","observation_id":"1a19588e-4b42-4fa6-9b8d-2366147fa7e7","resolution":{"observed_at":"2026-08-15T23:51:43.587466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.576006Z","title":null,"venue":null,"work_id":"653517c9-7b4e-49c4-8143-03c29143d3da","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.352242Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:7062dd2d9fcf461c8ae2d59de02cd3e21d6ff257855b5d7d61cb2cd4e4719b8e","observation_id":"b0742e58-0293-4282-beb3-d51d6bcd15dd","resolution":{"observed_at":"2026-08-15T23:51:43.578910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.567827Z","title":null,"venue":null,"work_id":"6f6cbcec-52b7-4fb0-8095-8921d751e42c","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.354989Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:e448d88ea8e88ce88c9eafc53b59ca710eb13325a6c30ea550b37aa572095968","observation_id":"45cf3b16-9885-4a08-98ce-3cbc662b9405","resolution":{"observed_at":"2026-08-15T23:51:43.570822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.559240Z","title":null,"venue":null,"work_id":"456a8292-b0c8-41f4-a7d6-fac4707428cc","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.357939Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:9da03f1d45ee195e6fdf6f6a04156b2f628cb5c8816b7809cd8ce48a3d095216","observation_id":"9bbcc85a-0281-456a-9068-466bffddca48","resolution":{"observed_at":"2026-08-15T23:51:43.562305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.550637Z","title":null,"venue":null,"work_id":"6b3ee025-6974-4a05-bcdc-228298eeb843","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.360589Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:cabc296eebe78dba91365fddc9dfcf80dab0f13e6d94abe276e19b3da40f6015","observation_id":"6636605a-6564-4d6c-86f4-90b27da15767","resolution":{"observed_at":"2026-08-15T23:51:43.553528Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.542497Z","title":null,"venue":null,"work_id":"acab95c9-75b5-4fd6-a068-4a1c168308a4","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.363312Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:054046dcf5b713fe6e12d9672fea5da79f0a9b5a7360c16b8821732e19869b11","observation_id":"21f1c732-01b6-48bf-a80d-1f7f50ab5d17","resolution":{"observed_at":"2026-08-15T23:51:43.545276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.533429Z","title":"who is the COOP leader in Amarillo","venue":null,"work_id":"4a958a8d-d951-43b0-9a3c-3ba8a60dd49e","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.365890Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:e00a4f5a1fa570243cd2ffc60343727f9f9d29559120e4d2716015193e31f59d","observation_id":"11882a9e-120b-4e7f-865e-3da02dbbca80","resolution":{"observed_at":"2026-08-15T23:51:43.536539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.523954Z","title":null,"venue":null,"work_id":"1ede2504-868b-4fc5-9b96-5fa04a6556fc","year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.368701Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:5402aec171ba5853704da3a41c8c1063fecfe67a132c500437a8e9f82ca016cf","observation_id":"00f96cd1-8200-47cd-83c8-1ec6ff9fe91b","resolution":{"observed_at":"2026-08-15T23:51:43.527742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:51:43.332744Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.332744Z"},"links":{"citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:ad2559024494008990568d998594321839c81efbca2d53a8f243f4a264a93114","observation_id":"3668f22e-e1fc-404e-806f-09de3c9ffead","resolution":{"observed_at":"2026-08-15T23:51:43.332744Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T11:21:55.369697Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":32,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2608.12764."}