{"as_of":"2026-08-14T15:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84274fe7455af228de4f2f7f048315b69039cf7dd21157cb445b8de5c754f0a8","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:45:04.656219Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00054/citation-record","integrity":"/paper/2507.00054/integrity","json":"/paper/2507.00054/citation-record.json","paper":"/paper/2507.00054"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.893528Z","title":", Aneja, J","venue":null,"work_id":"367e694a-d630-4027-ab9f-e53edec44fcd","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:44:59.832083Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:18a07e2380a7bf0393d0e46ec3fcc0b7c6dcbb7e31118f9463364925e2f0c43b","observation_id":"f9f7112a-3f5c-4430-89ce-ec48996e0545","resolution":{"observed_at":"2026-08-06T22:45:11.959401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.627147Z","title":", Vieillard, N","venue":null,"work_id":"40e8a69f-556d-4f97-bc6b-e5bfacfe71c9","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:44:59.887421Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:25e6e4638ddd20da6af1044659547f4332d40079cf3a7344ad19434749bc78b1","observation_id":"5334a726-edd3-4b45-a7fd-d1a4b28a4136","resolution":{"observed_at":"2026-08-06T22:45:11.756821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.363463Z","title":", Vieillard, N","venue":null,"work_id":"5f858bd5-5a02-4e5d-b512-5b01d6dc4f33","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:44:59.969850Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:4feea2a34bb4474123c66d1f288cb594e5c80980e2d31da8c6cb500114991923","observation_id":"7976eb97-c850-406e-8b1a-15efc9efb035","resolution":{"observed_at":"2026-08-06T22:45:11.433341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03730","last_updated":"2025-03-25T00:07:50Z","snapshot_observed_at":"2026-08-07T17:26:50.379012Z","submitted_at":"2025-03-05T18:40:19Z","title":"Towards Understanding Distilled Reasoning Models: A Representational Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03730","snapshot_observed_at":"2026-08-06T22:45:00.068336Z","title":"\\ Tegmark, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.068336Z"},"links":{"cited_paper":"/paper/2503.03730","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:1a2b94a5938edb5d1965f505a167c7f40f17f712dbac110fbe2a8f38eca46812","observation_id":"963a99e5-8b87-4347-bc6c-33ec5f7679fa","resolution":{"observed_at":"2026-08-06T22:45:00.068336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.110997Z","title":", Sastre, I","venue":null,"work_id":"d07dac7c-b5a9-4c34-9f9d-401cda981bf9","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.163772Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:0ae073e52a9da000f1ae559bfd6bfc7ef2e6267a9e9c8bf1ac0aa2a340d6e14a","observation_id":"9813e50b-31b0-44d5-a629-a293fc9c17f5","resolution":{"observed_at":"2026-08-06T22:45:11.259853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16737","last_updated":"2024-10-07T19:37:10Z","snapshot_observed_at":"2026-08-12T22:54:59.515243Z","submitted_at":"2024-08-29T17:32:35Z","title":"Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16737","snapshot_observed_at":"2026-08-06T22:45:00.253407Z","title":", Hosseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.253407Z"},"links":{"cited_paper":"/paper/2408.16737","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:c09d51a7f51e1a44b483f10ec5e1ab91672f910d32866d448527603364f7c6f9","observation_id":"ee832064-5677-498b-93ca-96c24d0a7770","resolution":{"observed_at":"2026-08-06T22:45:00.253407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.945346Z","title":", Peebles, B","venue":null,"work_id":"0597f818-fa3a-4d56-b369-372de2b8b262","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.323553Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:eaeb37f95eb6864261ab847a6960e70b1ab4cf8f7481a4f88423a651a56ac037","observation_id":"7ca5a211-4a5a-4bd4-8f10-23e74975e1db","resolution":{"observed_at":"2026-08-06T22:45:11.016657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T22:45:00.383119Z","title":", Kosaraju, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.383119Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:9460f1087936cbf07d203a5a92c3de49e76f261a8e921a8703ed28fc61a56e5f","observation_id":"8585932b-95fd-4e64-8168-4765ac6904cd","resolution":{"observed_at":"2026-08-06T22:45:00.383119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.798123Z","title":"\\ Ngo, C","venue":null,"work_id":"5c110a3f-3cbe-4f89-bd7d-36f05cf1b2ca","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.432702Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:42a6ca51668c0ea850f3eb5aaa636ffa4f5afe0e6ce2332c6b2a28ce3a919eae","observation_id":"ae03c8ce-0b48-4fad-9d78-2c9f0baa78ed","resolution":{"observed_at":"2026-08-06T22:45:10.872019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.594692Z","title":", See, A","venue":null,"work_id":"c62eb27c-48d9-4261-bb47-598ee305439a","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.499454Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:393e5766083bd3fc8cc08b47e2ed36c877bff489f3fb70e67980f52452968c70","observation_id":"b0065cb9-5d07-4763-8d75-6ddc406cc9e4","resolution":{"observed_at":"2026-08-06T22:45:10.714160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.443889Z","title":", Feng, B","venue":null,"work_id":"343fdcbb-58b5-4e87-828e-5dbc745c143e","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.562770Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:dc703cffb51c458c5feba5a3ef932a0c9e26a58c83c26c391359fcd936d2643f","observation_id":"fda81fd6-744d-48b2-a6d0-d940a7757342","resolution":{"observed_at":"2026-08-06T22:45:10.515033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.282148Z","title":null,"venue":null,"work_id":"234650e2-fef8-42cc-9e14-9594491c87b3","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.644914Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:028f3567dd3a38633ee3a75ce681fa802d5b42e63835d424b186486ffeb3442d","observation_id":"88c34840-15c4-4128-afbb-d71d4410be5d","resolution":{"observed_at":"2026-08-06T22:45:10.354570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.013477Z","title":null,"venue":null,"work_id":"b9796061-b525-4894-ba1e-490e7857bb93","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.717936Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:7b4d52f85cddc81d7ab9485167316dc0a2976e2e64fcea0b45d055f79be56584","observation_id":"8a236ce7-78d9-45d5-9e9a-3c7e6eb7b7cd","resolution":{"observed_at":"2026-08-06T22:45:10.118810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17927","last_updated":"2025-03-05T05:46:28Z","snapshot_observed_at":"2026-08-07T17:50:59.432318Z","submitted_at":"2025-02-25T07:47:22Z","title":"Advantage-Guided Distillation for Preference Alignment in Small Language Models","version":2},"cited_work":{"arxiv_id":"2502.17927","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17927","snapshot_observed_at":"2026-08-06T22:45:05.582957Z","title":"Advantage-Guided Distillation for Preference Alignment in Small Language Models","venue":"cs.CL","work_id":"5e1a78ef-e6de-4a93-9f4f-d4fe6373c871","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.774715Z"},"links":{"cited_paper":"/paper/2502.17927","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:ef644a95fd3ebb5564d35350fdc8b0e34d7c887f7ec7d9521cb1fcd721a7ecec","observation_id":"8af77e78-1dab-42c3-bf88-2b07b2c7012b","resolution":{"observed_at":"2026-08-06T22:45:05.664522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-13T16:04:46.474244Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-06T22:45:00.840611Z","title":", Dong, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.840611Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:2eda39ce82a7f5aa47fac4e7d45ca5a30e8b3946b2511ad040b8bc2904a2f6b7","observation_id":"ba453a7e-76aa-4268-970c-cc687a2a4b18","resolution":{"observed_at":"2026-08-06T22:45:00.840611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.785380Z","title":", Zhang, L L","venue":null,"work_id":"5a066683-1e18-4efc-be5e-2981b2ed52ac","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.916470Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:2cce7a8bf2f7fb5e5ebc82f7035d485342d86d4b9b85a5be8413c2c97ec5a777","observation_id":"ec3ea647-c2f7-4d1b-bdb7-e7e74b0b621e","resolution":{"observed_at":"2026-08-06T22:45:09.899083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:45:00.969331Z","title":", Yang, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.969331Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:4020a360b627864cbb4d4e82ec537bf1c978a157b9b311dc462a17890c8e85d1","observation_id":"3a330c4d-5b4f-4e1d-91db-ba0f3d6215db","resolution":{"observed_at":"2026-08-06T22:45:00.969331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.581809Z","title":", Vinyals, O","venue":null,"work_id":"c54a853d-6c4b-4999-b157-14cb63753b45","year":2015},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.034051Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:595b4ab823cfb087f225b1c8e72a2febd7ab91f8496ed8b5de1dd457c31a1fa5","observation_id":"2cc95be0-a373-4d5d-89c2-100f15211594","resolution":{"observed_at":"2026-08-06T22:45:09.681927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.372847Z","title":", Borgeaud, S","venue":null,"work_id":"138ba949-741e-48c2-9764-2799d18e00a6","year":2022},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.104215Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e966580f13665d8a0daf690cc84e4f113b772bf1437c24512be9feb098625b1d","observation_id":"2988ec95-7570-4805-86fe-20b740f166c6","resolution":{"observed_at":"2026-08-06T22:45:09.484507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.150998Z","title":", Li, C L","venue":null,"work_id":"a3046377-e2d5-4b56-9f24-b79b5a84cc0b","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.208161Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:ffeb5bd96fbe72ca1e628e9ea8d1e603e7b226e927761da266c0dbdaf39cfd43","observation_id":"38769f70-6b26-4119-a44c-9bc87c2dcc74","resolution":{"observed_at":"2026-08-06T22:45:09.258428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.939740Z","title":", Yin, Y","venue":null,"work_id":"f28ae1aa-e8b4-4463-ab93-1311ad2540ff","year":2020},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.282141Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:d6bf7c330052af7843623494f5802114e97174411ae2e5499a9a5f33aeea3f24","observation_id":"b2223c7a-1689-484d-a335-981e059a7d3c","resolution":{"observed_at":"2026-08-06T22:45:09.049575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16265","last_updated":"2024-06-26T14:01:15Z","snapshot_observed_at":"2026-08-12T23:58:05.632912Z","submitted_at":"2024-05-25T15:07:33Z","title":"MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16265","snapshot_observed_at":"2026-08-06T22:45:01.362923Z","title":", Li, X Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.362923Z"},"links":{"cited_paper":"/paper/2405.16265","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:ec45ca394bcc44ef3668ef48360ac5c8cd2264aa57e39d9ef9c9c83bbde7f941","observation_id":"c63aaa27-aeda-4fdf-b195-07a0ea7ca4b8","resolution":{"observed_at":"2026-08-06T22:45:01.362923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.736649Z","title":"\\ Rush, A M","venue":null,"work_id":"a8bcdb34-a68b-448e-970f-c15c6c51423f","year":2016},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.446884Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:63393009124e64e0ccaefcb8d3483890804ed988ada937116b82defb4ad3c3d5","observation_id":"ba9ae507-d70d-49b0-9c49-f1052c19a884","resolution":{"observed_at":"2026-08-06T22:45:08.841836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07067","last_updated":"2025-05-30T04:41:12Z","snapshot_observed_at":"2026-08-08T09:26:03.922623Z","submitted_at":"2025-03-10T08:51:32Z","title":"DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07067","snapshot_observed_at":"2026-08-06T22:45:01.511764Z","title":", Chen, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.511764Z"},"links":{"cited_paper":"/paper/2503.07067","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:0fc74332e37574a3389a4a0b9ae4ca18e58e569c54f47133a9e99755bedddcdb","observation_id":"d76b30f7-97b5-49f2-8da9-86c67609c337","resolution":{"observed_at":"2026-08-06T22:45:01.511764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-13T05:19:35.675322Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-06T22:45:01.602702Z","title":", Kim, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.602702Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:ff1841a4457fa1f2e089dd6151b947fac41d5a7bf6293f237c53859000be06bd","observation_id":"bf1372cb-2c2d-4815-b264-30df58d36e6d","resolution":{"observed_at":"2026-08-06T22:45:01.602702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.552416Z","title":", Fang, L","venue":null,"work_id":"b037061a-8752-49c2-9a08-c8f7f323b9d1","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.662995Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:d66d010f165ff2340155197d29585d3649c9478c1430ba8a5592c5bfb70bf864","observation_id":"bbfeb791-a91d-4c43-9cde-01ea480d017f","resolution":{"observed_at":"2026-08-06T22:45:08.621314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19545","last_updated":"2025-07-21T15:24:26Z","snapshot_observed_at":"2026-08-07T17:44:57.505841Z","submitted_at":"2025-02-26T20:34:58Z","title":"Winning Big with Small Models: Knowledge Distillation vs. Self-Training for Reducing Hallucination in Product QA Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19545","snapshot_observed_at":"2026-08-06T22:45:01.734181Z","title":", White, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.734181Z"},"links":{"cited_paper":"/paper/2502.19545","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:f1f20016d8ed08d8350a027b923b99ed16f05029444122cd28083c57fa7dbd22","observation_id":"1f40c54b-8e47-4293-9125-d763d5183b0d","resolution":{"observed_at":"2026-08-06T22:45:01.734181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19255","last_updated":"2024-07-02T03:46:03Z","snapshot_observed_at":"2026-08-13T04:07:08.803193Z","submitted_at":"2024-02-29T15:26:14Z","title":"GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19255","snapshot_observed_at":"2026-08-06T22:45:01.803122Z","title":", Cui, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.803122Z"},"links":{"cited_paper":"/paper/2402.19255","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:43a7bb4dbfca7ba05a79789e5b1b542f3cb1b4bd183b5cad58a9585f7ae2da2c","observation_id":"1f1635b6-be41-4bcb-aa4b-a089978da199","resolution":{"observed_at":"2026-08-06T22:45:01.803122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06414","last_updated":"2024-03-11T03:55:24Z","snapshot_observed_at":"2026-08-13T00:57:58.356157Z","submitted_at":"2024-03-11T03:55:24Z","title":"Evolving Knowledge Distillation with Large Language Models and Active Learning","version":1},"cited_work":{"arxiv_id":"2403.06414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06414","snapshot_observed_at":"2026-08-06T22:45:05.336125Z","title":"Evolving Knowledge Distillation with Large Language Models and Active Learning","venue":"cs.CL","work_id":"15763e85-a4fd-4839-ac0e-ac2dccd9f69a","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.899416Z"},"links":{"cited_paper":"/paper/2403.06414","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:bab51ed00176918c487d88cb68afd770c028b62129f3812325a0aae06688c1a7","observation_id":"a41021f4-9434-410f-86af-7fde9090a21d","resolution":{"observed_at":"2026-08-06T22:45:05.399923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.479552Z","title":", Chen, C","venue":null,"work_id":"a5ff8f40-210e-4a4d-bfc3-995d03086c7d","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.987456Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:07aefc567658a702600e2354b8bb7584f2cc0bc65d49daafb24dbda805030e1a","observation_id":"c9427546-55e8-4e8e-81c2-4f74cca695e4","resolution":{"observed_at":"2026-08-06T22:45:08.535787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.292134Z","title":", Yang, Z","venue":null,"work_id":"8b513eba-1904-4bc1-af6d-84006a11a776","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.050079Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:6d0b43de89dfc5b33b8151dfabc14a24b1cdf7128bd60a3ce8188f16aaabcec8","observation_id":"663344f9-7e30-47e0-89bc-9ac38933d316","resolution":{"observed_at":"2026-08-06T22:45:08.365808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.105231Z","title":", Dani, J","venue":null,"work_id":"d8847474-6ae0-4282-b844-26fc37758e8c","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.176949Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:10fd102f18724155a8596fa91cf54454a115f7756659fcd98ac36fc4ecc03306","observation_id":"335802d2-6c7b-402c-8a4f-1c2f5861e9a2","resolution":{"observed_at":"2026-08-06T22:45:08.178769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.889811Z","title":null,"venue":null,"work_id":"e1b132db-603d-4ae6-8ced-8344ea413c83","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.296854Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:847d4185b916063d1f14651690c7dcca26430b1c5ec60a51bdcce466123df45e","observation_id":"f6df0b60-2933-495f-86bb-c081bc56fa71","resolution":{"observed_at":"2026-08-06T22:45:08.012500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.688216Z","title":", Lerer, A","venue":null,"work_id":"5ecb3887-4763-4f77-99f9-b34eb28b7ba4","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.381998Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e5a3155b752035a3ce88ae036001572d12a78d7a8d7027ff6adbd5a9d170351d","observation_id":"71d9bb01-9f8b-4ccc-a41a-b8716ccb4285","resolution":{"observed_at":"2026-08-06T22:45:07.780048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05464","last_updated":"2024-10-07T19:49:24Z","snapshot_observed_at":"2026-08-12T22:28:47.258345Z","submitted_at":"2024-10-07T19:49:24Z","title":"Progressive distillation induces an implicit curriculum","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05464","snapshot_observed_at":"2026-08-06T22:45:02.463708Z","title":", Liu, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.463708Z"},"links":{"cited_paper":"/paper/2410.05464","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:001c156ff08e7b6c47b65c8d6a77e921c45711098797099ed59f15b021acc41e","observation_id":"710f5486-52fa-4b6d-8121-0e832a6133de","resolution":{"observed_at":"2026-08-06T22:45:02.463708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.479800Z","title":", Kim, D","venue":null,"work_id":"fe5ddbb3-bc9e-4a73-80b8-c277a6d426ea","year":2019},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.552158Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:d28bbd52218f0c232dadc9bbb656bbacd5db5b0e717bef2e3575b9a6d9535ae6","observation_id":"0d86e769-ece0-4b0e-8736-d57c1f90975d","resolution":{"observed_at":"2026-08-06T22:45:07.585952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.279975Z","title":"\\ Xie, S","venue":null,"work_id":"6a85706a-ea49-47a3-be30-9fa0e18d822d","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.621187Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:8019879c158818f5084f921572a0a091116ea5247d0ecc7343a82c9b6f3de292","observation_id":"17d3ac87-dd4d-41a7-bd6d-017ad7752bd1","resolution":{"observed_at":"2026-08-06T22:45:07.347692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04781","last_updated":"2024-05-08T03:11:12Z","snapshot_observed_at":"2026-08-13T00:12:39.135875Z","submitted_at":"2024-05-08T03:11:12Z","title":"CourseGPT-zh: an Educational Large Language Model Based on Knowledge Distillation Incorporating Prompt Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04781","snapshot_observed_at":"2026-08-06T22:45:02.697368Z","title":", Yin, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.697368Z"},"links":{"cited_paper":"/paper/2405.04781","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:46c6977b249d5ebed096fecf39b1f5453e0ef061b67b142b5fa3d3e90102df4a","observation_id":"dedb6313-b2d1-43cd-89cb-46c0ddf3e22b","resolution":{"observed_at":"2026-08-06T22:45:02.697368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-06T22:45:02.785656Z","title":", Debut, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.785656Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:183cd636bd0b9f874d30314b872fd97f0a37268760331cbcd29ee624aa596e28","observation_id":"ab12e167-1817-48ba-a32c-9941bc621f32","resolution":{"observed_at":"2026-08-06T22:45:02.785656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:45:02.881915Z","title":", Li, S S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.881915Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:9281df607ec286287d53e9041978191e52f70c149f56e16dc84cba3928c282a9","observation_id":"870979c2-4e34-441d-8bad-e60b4bcbc6c5","resolution":{"observed_at":"2026-08-06T22:45:02.881915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.143918Z","title":", Wang, P","venue":null,"work_id":"7fff8f9b-be77-4525-a482-2757a14545e6","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.953539Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:15f27cb00352629e1999eb3daaeef3d6a1839e5b9ec0e76412b67503300c42c0","observation_id":"f2c60319-8fc3-427f-901d-8f0079bc5860","resolution":{"observed_at":"2026-08-06T22:45:07.207353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T22:45:03.029566Z","title":", Shumaylov, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.029566Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:b31e3bf39ce61c3063274aa0579b5d52bb3a73cb95c6ca51f13b74a1c80dbe9c","observation_id":"98e0f490-a8be-44cd-9845-3e4ee7a4db71","resolution":{"observed_at":"2026-08-06T22:45:03.029566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T22:45:03.122039Z","title":", Kamath, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.122039Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:beb1cc818f97fa1eb44c85806990010d2fa34b800e22aae9e55310dfe9adeb31","observation_id":"13b7323d-6a46-4c54-9d5e-0eae71e6578a","resolution":{"observed_at":"2026-08-06T22:45:03.122039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.052835Z","title":", Riviere, M","venue":null,"work_id":"a57d15ae-b7d6-4e8b-a3e9-5e24b8ad8914","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.183890Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e13a667699afc7c5564f5d053644749247487fa76bbabe1a80de8084b4ec0627","observation_id":"48454789-9132-4ff1-9fe3-3a143de98d2c","resolution":{"observed_at":"2026-08-06T22:45:07.097328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.922541Z","title":", Han, Y","venue":null,"work_id":"9add0411-587b-47bc-971f-aa52da7e12ab","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.261446Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:c5da04219be60ce6d2f91887058ac97581445ee632adf9e8285c32a02401260e","observation_id":"e8406170-4e51-474e-9ba0-a26b4c29b939","resolution":{"observed_at":"2026-08-06T22:45:06.972873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02671","last_updated":"2025-02-04T19:26:28Z","snapshot_observed_at":"2026-08-12T19:27:02.778679Z","submitted_at":"2025-02-04T19:26:28Z","title":"On Teacher Hacking in Language Model Distillation","version":1},"cited_work":{"arxiv_id":"2502.02671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02671","snapshot_observed_at":"2026-08-06T22:45:05.037045Z","title":"On Teacher Hacking in Language Model Distillation","venue":"cs.LG","work_id":"3344ea39-4300-4d9b-b255-277c8360ac47","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.331296Z"},"links":{"cited_paper":"/paper/2502.02671","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:1714df52e61f9e8ff11b8132c1afc3b26390c0ac3de02bf2af6746aed32f6d3d","observation_id":"8a34b152-2464-440c-a5d0-9a7c4e36895b","resolution":{"observed_at":"2026-08-06T22:45:05.113351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06659","last_updated":"2025-05-20T13:38:24Z","snapshot_observed_at":"2026-08-08T14:43:50.006097Z","submitted_at":"2025-02-10T16:48:56Z","title":"Who Taught You That? Tracing Teachers in Model Distillation","version":3},"cited_work":{"arxiv_id":"2502.06659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06659","snapshot_observed_at":"2026-08-06T22:45:04.869692Z","title":"Who Taught You That? Tracing Teachers in Model Distillation","venue":"cs.CL","work_id":"c47a8e36-2074-4a7d-95b8-4fe7319dc1cb","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.441504Z"},"links":{"cited_paper":"/paper/2502.06659","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:00def42feed340e1bf8d61d9e61e6caf8313738f0690bc5681f7c2caa2d1018f","observation_id":"210ff84e-986d-4660-8fd8-a7be4c99448c","resolution":{"observed_at":"2026-08-06T22:45:04.943544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.795962Z","title":", Deng, Y","venue":null,"work_id":"75589b5f-b1d4-4102-b19c-68dd851f7801","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.513056Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:6178713008caa249af7bd880cc36e380d66528079e9184855f9e88714ddbf1af","observation_id":"42e753af-4bd2-485d-819e-d73112561ade","resolution":{"observed_at":"2026-08-06T22:45:06.848770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03350","last_updated":"2024-12-28T09:18:36Z","snapshot_observed_at":"2026-08-12T22:08:36.798924Z","submitted_at":"2024-11-04T04:43:01Z","title":"A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03350","snapshot_observed_at":"2026-08-06T22:45:03.646532Z","title":", Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.646532Z"},"links":{"cited_paper":"/paper/2411.03350","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:29e151af00c6eb4359d828a331520025ee26a97ec94ed0df7ae4dd6f90d47b2f","observation_id":"5fc159c6-a4f4-462a-8797-6b4e79b3f834","resolution":{"observed_at":"2026-08-06T22:45:03.646532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.681211Z","title":", Zhu, J Y","venue":null,"work_id":"f9f217c8-478a-4b38-9b77-4cc2391acf69","year":2020},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.749143Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:068a6b28fe7433e57d55000609c00c910296373e11504d01f487762bfa4a3dea","observation_id":"41d95ac2-3c60-4166-a078-0a33e91b1192","resolution":{"observed_at":"2026-08-06T22:45:06.722937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.545138Z","title":null,"venue":null,"work_id":"fd837107-665f-402f-9e7c-a85f7c19ea26","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.850600Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:55363b8cdee8718c003687bf7e3e23ffde868abefcff4cd238b029360448897c","observation_id":"ba61adf8-9c15-4502-b0db-7ff5881e1db4","resolution":{"observed_at":"2026-08-06T22:45:06.608963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.439438Z","title":", Wang, X","venue":null,"work_id":"b42a92f9-d760-4456-8352-3db7aec7e9d9","year":2022},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.920673Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:7d5b3ad5e106828387dc7d150a10977b2a092d6e106ecd4bd05376e3015f1c89","observation_id":"d3fcc0b3-7961-4740-aadb-991067663937","resolution":{"observed_at":"2026-08-06T22:45:06.488819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.329702Z","title":", Bai, H","venue":null,"work_id":"b23ee8e9-db71-4926-834d-ca6364ad13c9","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.977383Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:609b4b8dadbc00b08491399d3af4b29dbab35fbcc6d423e901f3dd61b4489ec1","observation_id":"8eafc91f-9730-40aa-b099-dbda10b62673","resolution":{"observed_at":"2026-08-06T22:45:06.376947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11325","last_updated":"2025-04-27T23:18:29Z","snapshot_observed_at":"2026-08-12T22:23:01.892725Z","submitted_at":"2024-10-15T06:51:25Z","title":"Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11325","snapshot_observed_at":"2026-08-06T22:45:04.144603Z","title":", Han, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.144603Z"},"links":{"cited_paper":"/paper/2410.11325","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:00e82e88b2c29e471c8111ea4f622786b814143b9c4d7bd55edab89a46e9ea2d","observation_id":"6290ed46-791e-4ba6-aeac-df36eb0ac94b","resolution":{"observed_at":"2026-08-06T22:45:04.144603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:45:04.222611Z","title":", Yang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.222611Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:24f21ff2a56db7433787e472154800d79a68e805ed2d1f9e2b55666c2346834b","observation_id":"c9a0cc89-1f21-4f07-be33-6c3063688a6b","resolution":{"observed_at":"2026-08-06T22:45:04.222611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T22:45:04.300085Z","title":", Tong, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.300085Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:5735c85e3701dd3f337e5ab4765b68a162f1a9068d0749f4533645d816f6e13d","observation_id":"5f3339e7-b708-4899-86bf-8386abf8fd21","resolution":{"observed_at":"2026-08-06T22:45:04.300085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.209968Z","title":", Wang, C","venue":null,"work_id":"58e5dba6-e66a-4d80-a620-ff631c5825bd","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.408916Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:60d1f552b891d62d8b1db9893b4d0488a0df418dc1dd45a90a372b342fe84e7c","observation_id":"012f0bf2-3f3d-406b-b1c2-e8c678c75d5e","resolution":{"observed_at":"2026-08-06T22:45:06.275447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.082193Z","title":", Zhu, R","venue":null,"work_id":"c21e7737-d15c-4487-9071-600846396ac6","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.485680Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:d0dbc213504b60c4e7dc2e771e3179769c613eaf518dcccf409ba21a7d6a2d4b","observation_id":"c1d9a273-3749-4648-b408-bc667bbe660f","resolution":{"observed_at":"2026-08-06T22:45:06.151692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:05.975068Z","title":", Zhu, R","venue":null,"work_id":"27d9d037-fe03-466e-b339-cc422cae964a","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.548728Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e4d47bbe7ee43b2182ce261464ab55269fba39f0549f8d4d1d292d95db91f817","observation_id":"d6cefc1b-c2e3-4129-a043-5a2f8a170d5d","resolution":{"observed_at":"2026-08-06T22:45:06.021904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:05.818092Z","title":", Shen, J","venue":null,"work_id":"3e1ef030-ac96-4370-8ede-261e668abe21","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.612738Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:b1fb6dc4f4ed178e65f218890c3c398c1807d8bef06417cf8a449e6a686c1e07","observation_id":"5b25e6b2-6caf-47bb-b638-48ef19505fc7","resolution":{"observed_at":"2026-08-06T22:45:05.904741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19557","last_updated":"2025-02-26T20:50:11Z","snapshot_observed_at":"2026-08-09T06:45:38.273472Z","submitted_at":"2025-02-26T20:50:11Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19557","snapshot_observed_at":"2026-08-06T22:45:04.656219Z","title":", Wang, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.656219Z"},"links":{"cited_paper":"/paper/2502.19557","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:591a762963fcd4a0392c26fa081214ea4feb1255671e5ac63a13176bcfaf8359","observation_id":"5dae83d3-89e7-4d02-807a-4b57195fbd38","resolution":{"observed_at":"2026-08-06T22:45:04.656219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":32},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2507.00054."}