{"as_of":"2026-08-11T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:193d49582c7d88895a3ff04f6044c4ec04bd040691b42ba32f6c3566613d7178","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:49.447695Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18952/citation-record","integrity":"/paper/2505.18952/integrity","json":"/paper/2505.18952/citation-record.json","paper":"/paper/2505.18952"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.172936Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.172936Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c10c23dd893bda7f368bca943f2c1c3b353b9ebfceabda8fe6c78565e91e7ce4","observation_id":"59addfc3-77f6-42dc-9b13-99b28a498885","resolution":{"observed_at":"2026-08-07T14:27:49.172936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.179006Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.179006Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:627112ee41b26103912f7d1536110c6aec78e90d5f5e265224c78675b059da7a","observation_id":"b69b458e-c723-4647-bb7d-58d1371ed75a","resolution":{"observed_at":"2026-08-07T14:27:49.179006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.184236Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.184236Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:353051956f1c952a4e5d328b31753d3a56d6e3337c247689e89eadbd67d368d9","observation_id":"66c8fd9c-96b9-4e6a-9be4-f58ce783a0ba","resolution":{"observed_at":"2026-08-07T14:27:49.184236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T14:27:49.189344Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.189344Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d4cf3688ab4f3a21d939265629a039f4d16edadb5a36723286b6b0073f084840","observation_id":"6d333c0d-b3e6-439f-b780-8e2532147483","resolution":{"observed_at":"2026-08-07T14:27:49.189344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.135615Z","title":"Claude 3 family","venue":null,"work_id":"02ee70e4-513e-4925-b47d-38b4cb93b9e3","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.193617Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:475fd775f7359fac5480cb1c7cc53e7a0788d45694be2c8e7e54f677ff6a6151","observation_id":"2282d970-697f-4073-aa62-40c41c0c9510","resolution":{"observed_at":"2026-08-07T14:27:50.139409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.122773Z","title":"Gpt-4 is openai’s most advanced system, producing safer and more useful responses, 2024","venue":null,"work_id":"3a08d398-a15e-4224-82bf-ccbe5585fe96","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.208501Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d8a182f1dc291e71e3b2e2391d7c7f8525351b8901348e3aab02c5988101ef0b","observation_id":"d52f406c-99ba-418d-b2c5-263817954980","resolution":{"observed_at":"2026-08-07T14:27:50.127285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-07T14:27:49.213678Z","title":"Value-incentivized preference optimization: A unified approach to online and offline rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.213678Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:fc93f7516791db078311319ab2a120520c78225c2883ea2abe678776d30cd563","observation_id":"710f5ccd-f9e6-472b-989a-e103c6851d94","resolution":{"observed_at":"2026-08-07T14:27:49.213678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.108849Z","title":"Knowledge distillation of black-box large language models, 2024","venue":null,"work_id":"9bfa0a74-ccbf-48d4-b575-21ce0dc0ee5d","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.219066Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:a871775e95fc84ca06f08b91e855e74819ef4d7efc7469c7cb8b6346f153ab01","observation_id":"e953fc06-285d-4d15-baab-417c2c7dc0e6","resolution":{"observed_at":"2026-08-07T14:27:50.113522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.095320Z","title":"Information-theoretic considerations in batch reinforcement learning","venue":null,"work_id":"79648a70-424c-45cf-9785-41143de173b3","year":2019},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.223575Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:0bf6f4e56f073af4508f8333f0ccf9bb12fa0947de0e714d76f9d30b86dbdb42","observation_id":"72cfc732-41d6-4d40-8a45-21290303f112","resolution":{"observed_at":"2026-08-07T14:27:50.100612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.082496Z","title":"Distilling knowledge learned in bert for text generation","venue":null,"work_id":"ed7cbdfe-91f5-433d-a556-d8b58e8236b1","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.227911Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3e4794857462516a19880478e933a3774137e9b2b572ce940b761d0509786b69","observation_id":"00ef125b-bfbd-47d0-a74b-e3139451a397","resolution":{"observed_at":"2026-08-07T14:27:50.087106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.232858Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.232858Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3af5f3bac0313fe0be03a2e67eab5963ca9e129c9d558ee1bbba486302fbbe00","observation_id":"4208ee3d-3827-491b-b60f-b8609a9c7a79","resolution":{"observed_at":"2026-08-07T14:27:49.232858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.236919Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.236919Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:93b2089f7ac7d2c96898d97623b4f6ba94f1cf842c22972ca747751002fa11dc","observation_id":"34ae95c8-2171-4fa9-8927-572d0ea0e9d7","resolution":{"observed_at":"2026-08-07T14:27:49.236919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:27:49.240934Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.240934Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:eac59e0a6fc55b9ffec2c0bee19847e1369d6effc2c6999427e4d590705a9fd2","observation_id":"ca2004ef-5cdb-4b16-8c46-a47a8af4582d","resolution":{"observed_at":"2026-08-07T14:27:49.240934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:27:49.244981Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.244981Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d79d605e3200c07b9894ace138fbe0f83002eed019d3bcd35c89ef7b55a9fc10","observation_id":"98b21e71-a03c-41e5-af1b-ba32a9930d78","resolution":{"observed_at":"2026-08-07T14:27:49.244981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.249279Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.249279Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:bf798721a435e2cb1525ffc0cfbb5aa889b2a57fde7bdb29a2f75085beec54ec","observation_id":"fdbadbfd-da79-4e23-a822-dc15546d48e4","resolution":{"observed_at":"2026-08-07T14:27:49.249279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.048653Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":"179f41e6-f71d-42d9-a9fc-d306156ad6b3","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.253183Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c3fd886f3ca396509feb9aa7c9d1635b712a2ff799682ec98b1476dbdbf03632","observation_id":"f3317dc0-9d1d-4283-97f0-72bd436f7dcc","resolution":{"observed_at":"2026-08-07T14:27:50.052465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.035560Z","title":"Stochastic linear optimization under bandit feedback","venue":null,"work_id":"d80b69d7-fb12-4b9a-bf7d-81ed0ed70514","year":2008},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.257789Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3630c2551eee58ba4e754e51bbed77629c5deb99bd5e6e4021d3e35e16ed47ad","observation_id":"4d41c677-2518-404b-a14c-a747c279317b","resolution":{"observed_at":"2026-08-07T14:27:50.040022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.024516Z","title":"Openllama: An open reproduction of llama","venue":null,"work_id":"8cdaae04-767b-4410-93bf-a1fcb589506a","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.262377Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:ede685a79d7dc1449b1cdcc0f4c08794d380ed72b039a9dffdebb0f1c8a56f55","observation_id":"ce12f250-4f44-48c1-ad61-7200fb8b2439","resolution":{"observed_at":"2026-08-07T14:27:50.028443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.266807Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.266807Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:affef133f73d5c3be86830fbdd203f16c3f5ac614a302c14ff1119298bafeb9b","observation_id":"ad3fb493-2ba3-4271-a22d-85192fab2dc5","resolution":{"observed_at":"2026-08-07T14:27:49.266807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:27:49.270567Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.270567Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:15cd9bffaff7bd058046bbe9b313a2d9fd2bc9febfc7a0a2f7b8c79faa7724fb","observation_id":"49e448cb-6a11-4e17-ae8d-5ecd6eb7f0f3","resolution":{"observed_at":"2026-08-07T14:27:49.270567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.275247Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.275247Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d86da549fb64911e0912b15dec25a658c0280bc6d8c8b51149fa809f54818bcf","observation_id":"3afeb083-cbd3-4ad9-8b15-2882493f894d","resolution":{"observed_at":"2026-08-07T14:27:49.275247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:27:49.279060Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.279060Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:e799223b568421636e06c97f927c3e1aee3e381f8b035100c23c0345dba4401b","observation_id":"afd52b7c-3055-4d4d-84ab-0bea56822713","resolution":{"observed_at":"2026-08-07T14:27:49.279060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.995307Z","title":"Unnatural instructions: Tuning language models with (almost) no human labor","venue":null,"work_id":"f52549ef-15ac-4cb6-bd59-f5b1b13fa1f0","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.283639Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c8e5429485ac4782795a64a5067dae0c5817f69e7e72ecf1a8c0124f8ea3a11a","observation_id":"04deee70-79ff-4e23-b213-0866dca0cf22","resolution":{"observed_at":"2026-08-07T14:27:50.001512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.978814Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"ad7502d2-a5b4-4bb4-9e26-1c90bc5b5815","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.287480Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:e3ef3ae38685b0af15e6d8ff7eee15ddcd1dc8ee2d5513cebcca21508207274d","observation_id":"095018b2-f406-4c49-a671-cd95e0e668e3","resolution":{"observed_at":"2026-08-07T14:27:49.983865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.958704Z","title":"Adversarial moment-matching distillation of large language models","venue":null,"work_id":"68879bf3-5ba2-472c-872d-67e4e03a0fb0","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.295167Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:a7549e1dbd8457958b5beaae38533738f3a6cb032cd582c8e63375fc3fabb4c8","observation_id":"ddd20eab-7613-46db-b578-35c42979b48d","resolution":{"observed_at":"2026-08-07T14:27:49.962918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.291106Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.291106Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:8fdc3423a2e65e736a74d60322d701b0d15d9d433ad5ce3fd07ae3195bed5251","observation_id":"9d3ce41b-3151-416d-944b-76ebfa0b15a2","resolution":{"observed_at":"2026-08-07T14:27:49.291106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.931364Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":"428d52a8-a0c9-4715-b79c-9b4531fca871","year":2016},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.303395Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:42e38039cb8bac9960d7377aceb66d87096cf9a33a1692125e2703c255a7cd7e","observation_id":"b7de2377-19f5-4805-8bd6-fb1023fece96","resolution":{"observed_at":"2026-08-07T14:27:49.935337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.944137Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":"e04e8532-0d7b-45e0-9c5d-254f7cefd2c5","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.299174Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:eaf3ead8ddd07fc97778ad5d652ecc325d1bfd6b39583096ace4afa4aca71d27","observation_id":"f367807d-13ac-45ef-b61b-4af49f4a7255","resolution":{"observed_at":"2026-08-07T14:27:49.948970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19774","last_updated":"2025-04-07T06:11:54Z","snapshot_observed_at":"2026-08-11T19:11:42.083130Z","submitted_at":"2024-06-28T09:23:40Z","title":"Direct Preference Knowledge Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19774","snapshot_observed_at":"2026-08-07T14:27:49.311523Z","title":"Direct preference knowledge distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.311523Z"},"links":{"cited_paper":"/paper/2406.19774","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c27386c3ad118a23823cc7952539382881eedbc9d3ae17061968a7f25bc39c93","observation_id":"5fbb818f-063b-466e-85ef-e368a5800469","resolution":{"observed_at":"2026-08-07T14:27:49.311523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.919327Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":"e3c6608c-33ee-44da-96b5-fe94f0ade347","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.307693Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d9d006297aec64a4aa4a45728803ce8175cde32da9ed9d8f72e53eb015eeffd8","observation_id":"28d439b1-116d-4074-9e5d-17e9966d8356","resolution":{"observed_at":"2026-08-07T14:27:49.923252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.895759Z","title":"Autoregressive knowledge distillation through imitation learning","venue":null,"work_id":"2993159c-bdcb-4f77-9f83-fe9f0878c86a","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.319541Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:061f85f84c7405c1351b56592dc0ece76da1d6d08ab6dc454d4dd68981bd78d8","observation_id":"59d05b33-e740-40c0-bf04-d1503d336845","resolution":{"observed_at":"2026-08-07T14:27:49.899697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.907187Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces, 2023","venue":null,"work_id":"30b17b0c-68e1-4cba-bfc1-6a7a90588b3e","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.315912Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:5c126c2b69da79de4ef36a1111f9d4c91479216e48591dba97385e84fd2c24c3","observation_id":"a062182a-381a-4113-a7ca-2b9a8f9fb9fa","resolution":{"observed_at":"2026-08-07T14:27:49.911217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09241","last_updated":"2023-12-14T18:58:28Z","snapshot_observed_at":"2026-08-10T15:38:33.372003Z","submitted_at":"2023-12-14T18:58:28Z","title":"TinyGSM: achieving >80% on GSM8k with small language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09241","snapshot_observed_at":"2026-08-07T14:27:49.328172Z","title":"TinyGSM: Achieving >80% on GSM8K with Small Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.328172Z"},"links":{"cited_paper":"/paper/2312.09241","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:02f15c467cee8f7fe291c94f48ab06af7584f688d49f67c3d7d1d603644f7c3f","observation_id":"2a94db03-1fd9-44d4-b52f-aaccfd86e1d6","resolution":{"observed_at":"2026-08-07T14:27:49.328172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.882135Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"07f16364-4928-4ce5-b6f2-30c5d9f26f94","year":2004},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.324021Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:ef51a418ae03afd481751a7077bea15a9a236d06a543975d93a1ede02d233c2f","observation_id":"0b1527a5-863c-4975-9caf-eb50e87ce8ad","resolution":{"observed_at":"2026-08-07T14:27:49.887728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.335177Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.335177Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:da8282e17f3ff5d137b7ae25b19901c1f891e3e902b8c82dcabf956ac6f10d11","observation_id":"d77b095e-aa7a-44bf-bc36-b8993ea832d3","resolution":{"observed_at":"2026-08-07T14:27:49.335177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T14:27:49.331916Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.331916Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:6c832c55afaa62be8271edcbe06cbe75a44e2b11ff20fd743ad912df50940e4d","observation_id":"c400cc17-38ff-4af9-9e18-eb952fb59898","resolution":{"observed_at":"2026-08-07T14:27:49.331916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.862006Z","title":"Linearly parameterized bandits","venue":null,"work_id":"cfb40de2-4ea0-479c-84f7-d1e6f97254c4","year":2010},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.343111Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:6652de63d1cf0bd015505c9fd0d39e53c7581a22afe6180178a91876ccc759dd","observation_id":"b82c11d5-5432-4c83-9329-afdfa5b23c4e","resolution":{"observed_at":"2026-08-07T14:27:49.866336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-07T14:27:49.338434Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.338434Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:0cf07fcac8167ee95080be8310b87b8e52a081d778fdf65fcebf576b66309535","observation_id":"d098173b-6f47-467a-becf-6decefae2354","resolution":{"observed_at":"2026-08-07T14:27:49.338434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.848706Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":"fe29878b-d5a6-4c48-86bf-b43af08c4898","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.351084Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d17a3314ee2cf64483a1b2498ca11d8ad542cff0308a0bf6830d7737218ce101","observation_id":"55a182ff-d4d1-48db-b5c8-ccd0febaee66","resolution":{"observed_at":"2026-08-07T14:27:49.852660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:27:49.346880Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.346880Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:8ad9651ca4842cf530cd13340d4224b9f2a01c10b2453d7e68aef9db4698b8ad","observation_id":"cf70783c-9ce3-47e1-a898-1a34128b8653","resolution":{"observed_at":"2026-08-07T14:27:49.346880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.823751Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":"d551fc60-0c6a-4d05-bae0-fd4760144e09","year":2019},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.361088Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:5f6b9feaf96b3188c66ec55860cd1d13791960d7bd9a895f57d7b39321a10a39","observation_id":"6f562761-1290-4e74-8baf-5206bf01bc0a","resolution":{"observed_at":"2026-08-07T14:27:49.827919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.835350Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"7a38fd93-3206-4f6a-9571-ade300826a71","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.356124Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d73da14a42ba28394e3948d1979336ca0845ee764065bcc7cb96ec9748c83677","observation_id":"9f0d88d0-0d9f-4a1c-8562-0d5b05c465e6","resolution":{"observed_at":"2026-08-07T14:27:49.840182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.799437Z","title":"Of moments and match- ing: A game-theoretic framework for closing the imitation gap","venue":null,"work_id":"28f15c3e-a07f-40fc-9e1a-4f7dd730da5c","year":2021},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.369280Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c81aea83bda13db82e68fdcba60e98f9fccc426216daffa7fb6d0ad7f7719c6d","observation_id":"8bf6598a-24a4-4fb3-a270-8dd9a7bb1ea4","resolution":{"observed_at":"2026-08-07T14:27:49.803933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.811928Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"3ac0bfa8-2a12-46c8-8bf1-6873b8206259","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.365451Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:29f7568dcd0167ba04e500012625f8be7bb7e8f2f538e19eaa14c2ae48fe1a8d","observation_id":"56170899-96d4-424b-831d-609f23fc7305","resolution":{"observed_at":"2026-08-07T14:27:49.816354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:27:49.379150Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.379150Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:df0c62d8fa1af83d4edf9784063a9fe91b0c0ae2f0c138d962fd40b76fa8c817","observation_id":"e2523298-82ef-452f-aff5-ac7a8ab597cb","resolution":{"observed_at":"2026-08-07T14:27:49.379150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.374653Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.374653Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:004f34a015345017f5b0f6d40bf563a733ffe98a4321c2059c5509cd49d43b92","observation_id":"79e79d0a-3303-4470-a879-5698d3738d7c","resolution":{"observed_at":"2026-08-07T14:27:49.374653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.387131Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.387131Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:f0b1cfd9182b39550be009fd13b7f7a7a4e6acb35edbfd22e0b45f7882692923","observation_id":"bbe4ff12-43fe-4232-bcd4-e15dd3add8bc","resolution":{"observed_at":"2026-08-07T14:27:49.387131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.778747Z","title":"Selective knowledge distillation for neural machine translation","venue":null,"work_id":"57b62431-2af8-45dc-a2ed-598c45bc09d7","year":2021},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.382987Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:78276c372d8ddcf88e211af571d7bda67ef7355823f9735e6b40f5a65c43fa81","observation_id":"30b4d144-9a8c-4fbf-88ff-0a0d427ae1d2","resolution":{"observed_at":"2026-08-07T14:27:49.783300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.747751Z","title":"Self-instruct: Aligning language models with self-generated in- structions","venue":null,"work_id":"b827d9ae-1602-4a83-96a6-73124aff41e4","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.395277Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:08bfb1eadaad1eb2b82437cb9a12af005a2db34bdd4de48529a11f3fd328cf92","observation_id":"7f0a7e71-d80b-4079-9c28-82e5807ba4a4","resolution":{"observed_at":"2026-08-07T14:27:49.751385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.759252Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"a1e00715-c13a-4c63-b1f0-c16c0acf1d5a","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.391263Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:cacf227cfcf805e000173251044681e37660afb1af0d89ea1d381ab8ec145d6a","observation_id":"ea241061-40c4-49a8-be59-4fa3a0749da7","resolution":{"observed_at":"2026-08-07T14:27:49.764237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.721628Z","title":"f-divergence minimization for sequence-level knowledge distillation","venue":null,"work_id":"a8105c85-a9b4-4f9f-ab86-e1ee35eb194a","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.403615Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:333198c44e42a8aabd11d6a2a91a1807c9aa8c9a0a80959e74e21c96ac806eb1","observation_id":"a7fd4a4a-8696-4e12-878d-91962d7ac8ec","resolution":{"observed_at":"2026-08-07T14:27:49.726555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.735428Z","title":"Super-naturalinstructions: Generalization via declarative instructions on 1600+ nlp tasks","venue":null,"work_id":"087cacb5-3055-429d-bd48-e5aa7d600f0a","year":2022},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.399435Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:fc753ad9ca3f8909212c4541c9568f9bef07714d7bb0cf75fc3c3f6c5d337088","observation_id":"9193a10d-b238-4dfa-b57a-18285898ac5b","resolution":{"observed_at":"2026-08-07T14:27:49.739753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:27:49.412002Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.412002Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:8b6c179b9d0891eb1db34d5826e97c52c6c247b009e06623df8dcd50c5be6ec8","observation_id":"31f262d2-7e67-4908-bc9b-f3c41959ec52","resolution":{"observed_at":"2026-08-07T14:27:49.412002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.408130Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.408130Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:45466df429ecf1a500fb918f0fe30a89f34833341af336fb5103c0a8d451138a","observation_id":"76c67b11-d524-4152-8e7a-03e5b443adc0","resolution":{"observed_at":"2026-08-07T14:27:49.408130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.690163Z","title":"Provable offline preference-based reinforcement learning","venue":null,"work_id":"1c6a3140-e2ec-4bfe-b928-c6c6de820432","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.420593Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:1b7c70a1b428f42bad799e4cc5d0a404a4b103030ee0fb3d463fa55644102131","observation_id":"c770c7b2-3bab-4173-b871-f675889b37eb","resolution":{"observed_at":"2026-08-07T14:27:49.694198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.701961Z","title":"Online iterative reinforcement learning from human feedback with general preference model","venue":null,"work_id":"57259eae-3ed1-4aea-9d42-1795b31503c9","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.415999Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:5fe7173db4aabb112fb9023edae2bce334955ed45ed0ba4087c70deccd70ed87","observation_id":"72392bfe-04c8-4e01-94bd-8013d2fedae8","resolution":{"observed_at":"2026-08-07T14:27:49.707419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.677882Z","title":"Plad: Preference-based large language model distillation with pseudo-preference pairs","venue":null,"work_id":"fc6beb09-97a2-4654-9922-22153f42ed5e","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.428701Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:726ef1d7dd2526939509690ff26b138b05dd25434f79a90a796c76f7949669d9","observation_id":"10a3c533-330a-43cd-8bf4-351f10f6a8fd","resolution":{"observed_at":"2026-08-07T14:27:49.682195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-07T14:27:49.424641Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.424641Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:b52f5b6fcfa4504bf40911e271374823356e460fca5fe7016d9cc0d33e6833f2","observation_id":"a52340ce-2c6a-4184-ad7a-2a7213c3799b","resolution":{"observed_at":"2026-08-07T14:27:49.424641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.436721Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.436721Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c7e21ad0555d3df630768323c8472ae320360dd235e332be7e685716f164de4e","observation_id":"84784f89-109a-40bb-bd27-586a98d19ecc","resolution":{"observed_at":"2026-08-07T14:27:49.436721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.432511Z","title":"Mathematical analysis of machine learning algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.432511Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c979ee1f96b92c1dbf70497f805bd1a528a5705bbf76ad4cefbcdaadb7d6c71c","observation_id":"3f336086-d72a-4518-ae58-2840ed8c28f1","resolution":{"observed_at":"2026-08-07T14:27:49.432511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.443540Z","title":"Starling-7b: Improving llm helpfulness & harmlessness with rlaif, November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.443540Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:a03cd5354cbf9bd83a8ad9e842ef61ecaa6beb5c9d6f1f9f59c9ded66f884267","observation_id":"8e007a6a-5f47-487e-b2f2-221b56409059","resolution":{"observed_at":"2026-08-07T14:27:49.443540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.649043Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":"c39e6e8b-7b82-4fbb-9c44-ececc81d51d8","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.440054Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:db22d23a8a9c084fffee2beecd8eb9f9ae3153854585de37ae41a67f2d0d0b81","observation_id":"7d12c72a-b00d-46dc-b77e-05f94e5f29cd","resolution":{"observed_at":"2026-08-07T14:27:49.654744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T14:27:49.447695Z","title":"s Pr(o | x, τ0, τ1) Pr∗ (o | x, τ0, τ1) # ≤ −2 logE x∼d0 ,τ0 ∼π0 |x,τ1 ∼π1 |x o∼Pr∗ (o|x,τ0 ,τ1 )","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.447695Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:dac8df21e65c21334cb0b2609da38f4b8d8842ff941148c66452d2dd79788faa","observation_id":"1dd11a70-1af2-4288-9ece-00b737f417f7","resolution":{"observed_at":"2026-08-07T14:27:49.447695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00754","last_updated":"2023-12-01T18:07:05Z","snapshot_observed_at":"2026-07-06T16:55:45.402426Z","submitted_at":"2023-12-01T18:07:05Z","title":"Measurements of nematic susceptibility with phase sensitive nuclear magnetic resonance in pulsed strain fields","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00754","snapshot_observed_at":"2026-08-07T14:27:49.203879Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.203879Z"},"links":{"cited_paper":"/paper/2312.00754","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:7667db59f7bccc828651bd3326d3c1c5f2c0de0b0b9cf6a146b69e6d5632fe30","observation_id":"ad94eeee-5986-4c0f-956d-b8a04ca31f6f","resolution":{"observed_at":"2026-08-07T14:27:49.203879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T19:52:55.282303Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2505.18952."}