{"as_of":"2026-08-18T00:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed13b2af3d62ea132f62a306876a9accce73a58920bace3304e278563c0166d3","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:49:37.950968Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08329/citation-record","integrity":"/paper/2509.08329/integrity","json":"/paper/2509.08329/citation-record.json","paper":"/paper/2509.08329"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:34.969319Z","title":"Leveraging more of biology in evolutionary reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:34.969319Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:7eb71bb99539e1bc05c13b720fac268fa679b0520d1c871571778b00107b8d09","observation_id":"97998644-e4a1-4020-a550-a00f6d742ba2","resolution":{"observed_at":"2026-08-04T20:49:34.969319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.052254Z","title":"Reinforcement learning: A survey","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.052254Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:3102b75ed8cd19d6b4c52b6be9a70cf12bc1eca2d51d3dee4033d292a12eb3f3","observation_id":"c79f6e3a-6f0c-4178-9e7f-8170e7c57446","resolution":{"observed_at":"2026-08-04T20:49:35.052254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.160418Z","title":"Model-based reinforcement learning: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.160418Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:517d2caa0c637687f0f434a046ad2b3eb4a0a583c937617b0c6861f03d3b4b1c","observation_id":"34f310e9-2063-451b-a77b-437c94e076ab","resolution":{"observed_at":"2026-08-04T20:49:35.160418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.377055Z","title":"Implementation of Q-Learning algorithm for solving maze prob- lem","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.377055Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:33367b4f8bcbc299f431007701008113f247a6e8ae03e6c3a7612131a7dcda04","observation_id":"820a1662-99eb-4d92-b9ca-db254e92371f","resolution":{"observed_at":"2026-08-04T20:49:35.377055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.477722Z","title":"Sequence learning: From recognition and prediction to sequential decision making","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.477722Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b5546767e7a6428a297f5978490ae504ee1fcaffece313827f57e1e0e75386bb","observation_id":"b2731e05-0d63-49c3-ae8f-e6780a86f9fd","resolution":{"observed_at":"2026-08-04T20:49:35.477722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.587138Z","title":"Deep reinforcement learning for sequence-to-sequence models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.587138Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:12bd175faf5570c69a7d28a646aa80b259d5edb9522cbde8eb6e9234b8360dec","observation_id":"bf08b2d6-0a04-4df6-abf1-3e1b1a14c4ec","resolution":{"observed_at":"2026-08-04T20:49:35.587138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.756581Z","title":"Adaptive look-ahead economic dispatch based on deep reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.756581Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:30f1542f70ae58d33f5221e7e3d7cbc085b7887a28fab983651097d80f8410e8","observation_id":"7e868f39-1469-4e0e-8d56-3512a90b8b41","resolution":{"observed_at":"2026-08-04T20:49:35.756581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.834370Z","title":"Recent developments of game theory and reinforce- ment learning approaches: A systematic review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.834370Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:0d3afdcf016c6ec560ec19b97beb59ed0025353bc1f251375708a7a237c653ce","observation_id":"382bac6f-afd6-418c-8d7b-5b2176d1caf2","resolution":{"observed_at":"2026-08-04T20:49:35.834370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.919416Z","title":"Recent advances in reinforcement learning-based autonomous driving behavior planning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.919416Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:bd192d3107308b98fc2c1e388e5e9b35862274170162c8ba865df5a37e361f40","observation_id":"850b7ca9-92ae-44e6-80db-9f70a33b25a9","resolution":{"observed_at":"2026-08-04T20:49:35.919416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.018720Z","title":"Rein- forcement learning for autonomous process control in industry 4.0: Advantages and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.018720Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e612dd63d0ff01417ea18830fb86a2c21d820d54a668879823dd6a449fb37c32","observation_id":"9efd5625-d009-4fa2-bf0f-8182676441b7","resolution":{"observed_at":"2026-08-04T20:49:36.018720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.122336Z","title":"A review of safe reinforcement learning: Methods, theories and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.122336Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ef3397120269bd40964164f4af25256fc2b3f431fbdf6dcbf3c1ba6c39dea40e","observation_id":"616f27f5-48e6-4a55-be90-9af4abd9da0e","resolution":{"observed_at":"2026-08-04T20:49:36.122336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.261063Z","title":"Distributed deep reinforcement learning based gradient quantization for federated learning enabled vehi- cle edge computing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.261063Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:026a4545b5f47f546d7ded07052d6893a6ccc058e006d18aa325783ccc65cf0f","observation_id":"56a2af26-ba0a-43bd-a36f-becdce148d43","resolution":{"observed_at":"2026-08-04T20:49:36.261063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.361800Z","title":"A review of research on reinforcement learning algorithms for multi-agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.361800Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:74d0670a6c903c780cae8643f92e29ba6de2f00632dd874deb14440aaab39893","observation_id":"5bde60e4-7b2c-4bbc-b1df-ad5dce53b398","resolution":{"observed_at":"2026-08-04T20:49:36.361800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.435227Z","title":"Toward enhanced reinforcement learning-based resource management via digital twin: Opportunities, applications, and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.435227Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:633fcca01c0b5232353dce65196adb8390248db1feff82677e21709c5051adf9","observation_id":"bb36baed-bee1-4509-9533-f174a228d9b0","resolution":{"observed_at":"2026-08-04T20:49:36.435227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.535488Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.535488Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2191dd75b0ffccc82c3c4b7d42238eef0b44408597cbc4280819d09ed7836281","observation_id":"4a718f5b-19d3-4b29-9a15-f13c145ebb75","resolution":{"observed_at":"2026-08-04T20:49:36.535488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.650605Z","title":"Evolu- tionary reinforcement learning: a systematic review and future directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.650605Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:4643e1c8d27afc525f64b8d696cbe88df69f4f6af2cfce30bd701c40ed33e18e","observation_id":"c207e56b-9b43-485d-9dfc-fe9d160967de","resolution":{"observed_at":"2026-08-04T20:49:36.650605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06463","last_updated":"2024-11-10T13:35:10Z","snapshot_observed_at":"2026-08-17T13:05:57.831790Z","submitted_at":"2024-11-10T13:35:10Z","title":"RL-Pruner: Structured Pruning Using Reinforcement Learning for CNN Compression and Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06463","snapshot_observed_at":"2026-08-04T20:49:36.776845Z","title":"Rl-pruner: Structured pruning using reinforcement learning for cnn compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.776845Z"},"links":{"cited_paper":"/paper/2411.06463","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:7597e8428d2af8b27399b68e09e0a3f6916039355a23e3ddb04edb73b2bead98","observation_id":"6c017dfb-3f69-4f08-90ca-fae28ecfb380","resolution":{"observed_at":"2026-08-04T20:49:36.776845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.880267Z","title":"A Reinforcement Learning Training Acceleration Method Based on Knowledge Distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.880267Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d62ac3135d786949c612eed29bc07c0b256957a7bfd27121a2612060822a135e","observation_id":"37eb84f2-8d3a-4e10-afa7-b5768e6658d0","resolution":{"observed_at":"2026-08-04T20:49:36.880267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.993310Z","title":"Plan-based reward shaping for reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.993310Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:44b83102aad7a3b2a64edd1ea98220340e5d0d1f5094bfab04fa9fe5f34d6afa","observation_id":"ef49b158-ab05-4ac1-bbbf-565c6e550954","resolution":{"observed_at":"2026-08-04T20:49:36.993310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.095843Z","title":"Cur- riculum learning for reinforcement learning domains: A framework and survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.095843Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b660c8db582b661ff66d424cf9656d1fc9239400bda7b3934991c70a76fb23f8","observation_id":"6279c055-d5d8-495c-907a-9d83eb08c3c8","resolution":{"observed_at":"2026-08-04T20:49:37.095843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.202554Z","title":"Learning for a robot: Deep reinforcement learning, imitation learning, transfer learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.202554Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b39325568fc40683a67eabe08211aa384395f0cc8047fabfac71b603f5e01fae","observation_id":"bda7df39-dbd7-42f9-92e9-eb3f2758db26","resolution":{"observed_at":"2026-08-04T20:49:37.202554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.320789Z","title":"Meta-learning in reinforcement learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.320789Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1c142e58ec70743ea585676c464a5cbc03d71f97d88b4b074a7c5eb7c78c6c9a","observation_id":"8e3be7d4-cfe9-4dca-9b49-c9c20463f502","resolution":{"observed_at":"2026-08-04T20:49:37.320789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16181","last_updated":"2024-02-25T20:07:13Z","snapshot_observed_at":"2026-08-16T14:15:30.607587Z","submitted_at":"2024-02-25T20:07:13Z","title":"How Can LLM Guide RL? A Value-Based Approach","version":1},"cited_work":{"arxiv_id":"2402.16181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16181","snapshot_observed_at":"2026-08-04T20:49:38.670045Z","title":"How Can LLM Guide RL? A Value-Based Approach","venue":"cs.LG","work_id":"9ccf02cd-8c73-414c-83e2-7cb3061938c6","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.369250Z"},"links":{"cited_paper":"/paper/2402.16181","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f2f25f6cc5ad7c548fff887a568674c44d9d64d734d1b618d93c4647311467a6","observation_id":"a83b7b2c-630d-41c5-8d9e-db6c08b215e3","resolution":{"observed_at":"2026-08-04T20:49:38.673521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:49:37.442918Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.442918Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c64ed752be2de53ba434177aafbe5a01038b758d17577f0d6312be9a6cb64de1","observation_id":"cf13cf78-cf9a-4331-8e3c-a3fba642522a","resolution":{"observed_at":"2026-08-04T20:49:37.442918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T20:49:37.562259Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.562259Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:8b4443692d4e863f02e73281de0db119e93f7c72648fe25cdc1ed5b07e6c152d","observation_id":"e52e8950-48be-4834-b1c4-cc78dd31c809","resolution":{"observed_at":"2026-08-04T20:49:37.562259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-04T20:49:37.666569Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.666569Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:8c35c7f528a61fcd495893c1abb2535a5b86ecd84319e68c66e2bf6d6a530031","observation_id":"a0f7a012-0b4a-4f90-b47f-fbaa755b948e","resolution":{"observed_at":"2026-08-04T20:49:37.666569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04268","last_updated":"2023-08-08T14:09:33Z","snapshot_observed_at":"2026-08-16T15:09:58.251401Z","submitted_at":"2023-08-08T14:09:33Z","title":"Teacher-Student Architecture for Knowledge Distillation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04268","snapshot_observed_at":"2026-08-04T20:49:37.679757Z","title":"Teacher-student archi- tecture for knowledge distillation: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.679757Z"},"links":{"cited_paper":"/paper/2308.04268","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b9a72845083db04ad1c3cb1f42459c2006e4616e761e2eed64cb52ec5007b378","observation_id":"913436a7-c629-4377-b252-e8cf67bbe361","resolution":{"observed_at":"2026-08-04T20:49:37.679757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18978","last_updated":"2024-04-29T14:53:48Z","snapshot_observed_at":"2026-08-16T13:56:56.438810Z","submitted_at":"2024-04-29T14:53:48Z","title":"Towards Generalizable Agents in Text-Based Educational Environments: A Study of Integrating RL with LLMs","version":1},"cited_work":{"arxiv_id":"2404.18978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.18978","snapshot_observed_at":"2026-08-04T20:49:38.619462Z","title":"Towards Generalizable Agents in Text-Based Educational Environments: A Study of Integrating RL with LLMs","venue":"cs.LG","work_id":"e46f51a4-0553-4f20-bc62-9bec4db16005","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.683840Z"},"links":{"cited_paper":"/paper/2404.18978","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:4bc804807f1a28be21aa356266a36d0dd6a22634ee59e4e4a05abd254877b01e","observation_id":"e04ffcf8-cdfd-4dbd-884c-1b5eaac566bd","resolution":{"observed_at":"2026-08-04T20:49:38.622706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.698214Z","title":"Intelligent Control of Closed-Loop Sedation in Simulated ICU Patients","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.698214Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f8ac1b6e8bec1a40c64c67c8fdff41e41d9131ac0acaa8e2cb277e444ef4cbb8","observation_id":"b0066dd9-a966-4ce1-ab4f-09c8b0de1e33","resolution":{"observed_at":"2026-08-04T20:49:37.698214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.702112Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.702112Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a840e886551cf002421808091b91bcb5f6264ec3320cc0183a2bfe5cff564488","observation_id":"1597274e-961e-4ec4-944f-f03f2bc0ae98","resolution":{"observed_at":"2026-08-04T20:49:37.702112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.705793Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.705793Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:780513ee459ce117e8cc1812f1351f054ffa086cf9b984ccbb8d899f1466a782","observation_id":"acd467bf-ea7c-4160-a5b2-b9d962c60299","resolution":{"observed_at":"2026-08-04T20:49:37.705793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.709322Z","title":"A reinforcement learning approach to obtain treatment strategies in sequential medi- cal decision problems","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.709322Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:72286e8c12571ca89c959c718504ab9a0fcb549ccb0faaeb6a13e7611211f782","observation_id":"34523da3-6534-4058-b5aa-cc1ead0ac15a","resolution":{"observed_at":"2026-08-04T20:49:37.709322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.712892Z","title":"Rein- forcement Learning for Closed-Loop Propofol Anesthesia: A Study in Human V olunteers","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.712892Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:87e836c2a0c7f209f7b3de4816d9550ddfa6aaa0e0ad8962166cf0273a8469a8","observation_id":"53a8f259-8ef5-400f-a719-c7ccf1e195ef","resolution":{"observed_at":"2026-08-04T20:49:37.712892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1134/s1064226919120131","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"7. Using Reinforcement Learning in the Algorithmic Trading Problem","venue":"Journal of Communications Technology and Electronics","work_id":"3296875a-0c09-4a68-af35-63cb95fb992e","year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.716869Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:83f685f9bc6c3ae70c317ddc9b1585a82525677c95591b7a0e194c940a42cc4c","observation_id":"347e3caa-c511-46cc-b297-818ee7f161cb","resolution":{"observed_at":"2026-08-04T20:49:38.108475Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.87013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.604500Z","title":"Deep Reinforcement Learning for Optimizing Finance Portfolio Man- agement","venue":null,"work_id":"50a2008f-3613-4cd8-ab11-4bef6ada4c7d","year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.720364Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c430a102fb021bf8cb3c86fffbbb2ca080b7bab21c874fb88837b9c096052e9b","observation_id":"a3256e0d-893c-444e-9021-ae12db819375","resolution":{"observed_at":"2026-08-04T20:49:38.609023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04240","last_updated":"2018-05-21T18:25:38Z","snapshot_observed_at":"2026-08-15T07:10:04.265351Z","submitted_at":"2018-02-12T18:41:57Z","title":"Reinforcement Learning for Solving the Vehicle Routing Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04240","snapshot_observed_at":"2026-08-04T20:49:37.723759Z","title":"Deep Reinforcement Learning for Solving the Vehicle Routing Problem","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.723759Z"},"links":{"cited_paper":"/paper/1802.04240","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ab47025d55d4761e9ee59ce99230198771a81e20c1f52b68a5ac5d9d3f7ed7c1","observation_id":"c53ff995-c701-4e02-8882-a2275dbdb1ab","resolution":{"observed_at":"2026-08-04T20:49:37.723759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.89676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.579439Z","title":"Reinforcement Learning Boat Autopilot: A Sample-efficient and Model Predictive Control based Approach","venue":null,"work_id":"3dd3f914-c615-4a9e-bebf-1f76cffe184c","year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.727569Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:623c903d2e3fc445846eff307378df4d7225876d8ee761ff255eed34fda2e35c","observation_id":"2c21783d-75c7-4b29-975f-3a8c51007b14","resolution":{"observed_at":"2026-08-04T20:49:38.584549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.730776Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.730776Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c57ba1fa6ee876079cf50e3935532925cbb50ea837998ad28fc05bdc401af5e0","observation_id":"54991b6d-13a6-4817-a373-dd84d3210b0b","resolution":{"observed_at":"2026-08-04T20:49:37.730776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.733754Z","title":"Reinforcement learning in artificial and biological systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.733754Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:777d5a83afde431be0d72cc3f0f3a0d701c8b238a6d21ba6748d17fe3bdcf199","observation_id":"e0e642b9-ee61-4a04-996d-35055efbedef","resolution":{"observed_at":"2026-08-04T20:49:37.733754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.737230Z","title":"Introduction to reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.737230Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f14a3b3ebbb07418273815fa0f288027e0ca1fc4ee2c361fe1201732ad81e386","observation_id":"0668dfd1-9c6f-4d29-a824-321a3255a638","resolution":{"observed_at":"2026-08-04T20:49:37.737230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.740802Z","title":"A generalized reinforcement-learning model: Convergence and appli- cations","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.740802Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:51363269524784d8c2e7310ceb1ca5d38a2bd82d28f718c0199a8625af53534b","observation_id":"4b58e068-7a7c-4c2f-8d16-18e029473e81","resolution":{"observed_at":"2026-08-04T20:49:37.740802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.743964Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.743964Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e20c9142020edf0940b179ca8c2cb6335e5251452b50c1e8975adb87d1521269","observation_id":"ccf8d915-cb40-4d7d-98b0-323acc5edf54","resolution":{"observed_at":"2026-08-04T20:49:37.743964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.747016Z","title":"Value-free reinforcement learning: policy optimization as a minimal model of operant behavior","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.747016Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:dc938c3c709ed587f4222b62c83b4f99948c467118ee1e950b1a3ce7d81498bb","observation_id":"8b5c1543-1014-43c2-97c2-b3a5d7bdbaba","resolution":{"observed_at":"2026-08-04T20:49:37.747016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.859373Z","title":"Actor-Critic Reinforcement Learning and Ap- plication in Developing Computer-Vision-Based Interface Tracking","venue":null,"work_id":"f00c3990-2312-4c0d-a396-52caaae10839","year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.750197Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ade5b90ce296ed8fa75192f2a0c702ce5b867f2596ca921f828bdd0c2921f3aa","observation_id":"2b0fb647-960b-40ae-96f3-0d4afa374a99","resolution":{"observed_at":"2026-08-04T20:49:38.862730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.849070Z","title":null,"venue":null,"work_id":"8bf05cc4-bea5-4587-ae7e-fd04a3c16ffa","year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.753240Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:aa7ab564f6bae15b756b3edb8e5e48ada5ebdfedc58f2bbb0ef5e83ab307f9d6","observation_id":"839563fb-30a3-40a9-879d-a59e2a374504","resolution":{"observed_at":"2026-08-04T20:49:38.852218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T20:49:37.756531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.756531Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a30f1791349deb55e653d5399d16717dd3dbd0e97781df91dadd76f27785e8c0","observation_id":"7a4a842e-b2c9-4199-a853-d628c09366ae","resolution":{"observed_at":"2026-08-04T20:49:37.756531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-04T20:49:37.759899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.759899Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:38b72c21f6f13bd53e5ed568e55eaace5e04c08d89ab1ac195e8031dda01013d","observation_id":"d7f5c7ec-2cb9-4311-a3c5-9a50cccdc799","resolution":{"observed_at":"2026-08-04T20:49:37.759899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-04T20:49:37.763648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.763648Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a7bce1d468f04e5be53e2e110ef3a2c0c09c44be54d92a2951ce6e35a461d4cb","observation_id":"c73edb9b-9207-47b4-a80d-777ac9b2c41d","resolution":{"observed_at":"2026-08-04T20:49:37.763648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.766956Z","title":"Large language models surpass human experts in predicting neuroscience results","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.766956Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:346f68b058a7b441345889074d3f5b83d4e204288bcc67f584f1acc125191c41","observation_id":"169ab558-0904-4eea-bb73-fc619308b5ed","resolution":{"observed_at":"2026-08-04T20:49:37.766956Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08910","last_updated":"2020-10-05T21:26:45Z","snapshot_observed_at":"2026-08-15T17:58:46.639035Z","submitted_at":"2020-02-10T18:55:58Z","title":"How Much Knowledge Can You Pack Into the Parameters of a Language Model?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08910","snapshot_observed_at":"2026-08-04T20:49:37.770353Z","title":"arXiv:2002.08910 [cs.CL].URL:https://arxiv.org/abs/ 2002.08910","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.770353Z"},"links":{"cited_paper":"/paper/2002.08910","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:0ff4dfd3a78619a1a9974ed858fd509f20e18359c87b5250b84988248a95b6d5","observation_id":"485da6c9-08c4-4a10-8cbf-b76a49004695","resolution":{"observed_at":"2026-08-04T20:49:37.770353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00297","last_updated":"2021-09-10T00:54:47Z","snapshot_observed_at":"2026-08-16T18:54:44.892096Z","submitted_at":"2021-01-01T19:01:09Z","title":"Analyzing Commonsense Emergence in Few-shot Knowledge Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00297","snapshot_observed_at":"2026-08-04T20:49:37.773737Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.773737Z"},"links":{"cited_paper":"/paper/2101.00297","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ee7da289753b79765fa5fd88135241588c5655907531975ac27991c925fdbf14","observation_id":"9c18f6c0-8fca-4bcd-ae23-f34ed48ba83b","resolution":{"observed_at":"2026-08-04T20:49:37.773737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06474","last_updated":"2023-05-10T21:43:42Z","snapshot_observed_at":"2026-08-17T15:04:52.609713Z","submitted_at":"2023-05-10T21:43:42Z","title":"Do LLMs Understand User Preferences? Evaluating LLMs On User Rating Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06474","snapshot_observed_at":"2026-08-04T20:49:37.776970Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.776970Z"},"links":{"cited_paper":"/paper/2305.06474","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:78fdf3a45d755c0d40f63c661ae60bf24dbe53e5431d232000efd3f6c30daab3","observation_id":"0b5c305f-85f3-488f-adda-02849442b081","resolution":{"observed_at":"2026-08-04T20:49:37.776970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.780199Z","title":"TALLRec: An Effec- tive and Efficient Tuning Framework to Align Large Language Model with Recommendation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.780199Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:7ebeaa47e7f444d1bcfff617da92432f1b70b2c79db339a1cc7aa8c8598312d3","observation_id":"9f8804ac-45b9-4662-98e4-939c42c56458","resolution":{"observed_at":"2026-08-04T20:49:37.780199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.838310Z","title":"LLM-Rec: Personalized Recommendation via Prompting Large Language Models","venue":null,"work_id":"e617de42-b1ee-4e1a-8774-a232a22bb917","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.783309Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:66f6a35ca1a8fffc61e64e2efb9e24a3f9d3be47eb99489001e0c649bac4c457","observation_id":"8eea794a-f34f-4b0f-871a-1ac091ca6bd7","resolution":{"observed_at":"2026-08-04T20:49:38.841829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.827666Z","title":"Review-driven Personalized Preference Reasoning with Large Language Models for Recommendation","venue":null,"work_id":"8aeed9ad-0281-416d-b9ad-fe1af0bf7178","year":null},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.786263Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:7f1807d31295b0ff06e40569a4d8bbd92eef29ec8b0c65dbace13ba99e17d558","observation_id":"71897617-f03c-4e26-b5b0-151f869fecf6","resolution":{"observed_at":"2026-08-04T20:49:38.831431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.794271Z","title":"Wordcraft: Story Writing With Large Lan- guage Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.794271Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:448c490d0d1748d145dc006089f468b60048f214b208426c78fcd72d80785b34","observation_id":"c677e816-9da8-457b-8bb7-e528754de729","resolution":{"observed_at":"2026-08-04T20:49:37.794271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.11350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.477508Z","title":"A comprehensive survey on integrating large language models with knowledge-based methods","venue":null,"work_id":"42e3c109-48ae-455b-a601-ae767be5ba86","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.797358Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a773651eaf71a1520b18b8cf1cd0ec4bde4e32441e63c0febe310b61907ace4e","observation_id":"e341a6e8-33f9-4a6f-a4c2-604358fccd77","resolution":{"observed_at":"2026-08-04T20:49:38.482722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07984","last_updated":"2023-10-12T02:17:59Z","snapshot_observed_at":"2026-08-16T14:52:51.862935Z","submitted_at":"2023-10-12T02:17:59Z","title":"Large Language Models for Scientific Synthesis, Inference and Explanation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07984","snapshot_observed_at":"2026-08-04T20:49:37.800923Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.800923Z"},"links":{"cited_paper":"/paper/2310.07984","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e43f17449c5da1f860687dfa03466e1bfecca487ec63fee224674245e9633e78","observation_id":"320b0594-c9cb-4101-9eb6-3d784beb10ea","resolution":{"observed_at":"2026-08-04T20:49:37.800923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01063","last_updated":"2025-02-05T14:42:36Z","snapshot_observed_at":"2026-08-16T13:29:01.990780Z","submitted_at":"2024-08-02T07:31:57Z","title":"Leveraging Encoder-only Large Language Models for Mobile App Review Feature Extraction","version":2},"cited_work":{"arxiv_id":"2408.01063","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01063","snapshot_observed_at":"2026-08-04T20:49:38.454667Z","title":"Leveraging Encoder-only Large Language Models for Mobile App Review Feature Extraction","venue":"cs.CL","work_id":"82e372b4-6d92-4245-981a-be9d48f1288d","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.804114Z"},"links":{"cited_paper":"/paper/2408.01063","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9d8afd614ce7f3279acc9517709e6142df5d97f961996f081838d5b493cd9668","observation_id":"f258a823-2377-476b-86e8-218e3598e0d6","resolution":{"observed_at":"2026-08-04T20:49:38.458130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02990","last_updated":"2024-07-02T07:59:40Z","snapshot_observed_at":"2026-08-16T14:12:38.316255Z","submitted_at":"2024-03-05T14:11:54Z","title":"Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02990","snapshot_observed_at":"2026-08-04T20:49:37.807472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.807472Z"},"links":{"cited_paper":"/paper/2403.02990","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:52889716d202587025fcc527b7d0f4b918bdbae5323dc295ed758104567b96fd","observation_id":"d52c73ad-74e1-4e7d-bcd0-a80835ca7701","resolution":{"observed_at":"2026-08-04T20:49:37.807472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16361","last_updated":"2024-10-27T19:35:47Z","snapshot_observed_at":"2026-08-16T15:04:28.426871Z","submitted_at":"2023-08-30T23:28:43Z","title":"Large Language Models as Data Preprocessors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16361","snapshot_observed_at":"2026-08-04T20:49:37.811300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.811300Z"},"links":{"cited_paper":"/paper/2308.16361","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:127d47be868d42f72a40b4cfe1a8cc1ed83dd9040a9c85ab656145c1427dc718","observation_id":"167ab8dd-bad4-450b-9ae0-7a8b773e333e","resolution":{"observed_at":"2026-08-04T20:49:37.811300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.817535Z","title":"DiarizationLM: Speaker Diarization Post-Processing with Large Language Models","venue":null,"work_id":"af68b5aa-fa13-4722-b737-40650740211f","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.815064Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:190f3422931e996915dbc6ed468fb5bb3d1980fad35f976d1d4b0274c8ba76aa","observation_id":"c25e1175-70f2-4f7b-994b-d805a28f3250","resolution":{"observed_at":"2026-08-04T20:49:38.820945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.818378Z","title":"Data Augmentation for Intent Classification with Off-the-shelf Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.818378Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:df1cd3fe94b42057c2f594a93f197d9edf2e479f98f85a300b124d79031395b1","observation_id":"52f1937a-41ac-4b9b-8cb2-d023b6eb67c9","resolution":{"observed_at":"2026-08-04T20:49:37.818378Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.821853Z","title":"When and how to paraphrase for named entity recognition?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.821853Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a6a5ed62cf756a6f95734bfba456aab7439813e560a96990a2f8d7b7d4edea78","observation_id":"7b17a9e9-a00a-4fb3-b3f6-3743389564d0","resolution":{"observed_at":"2026-08-04T20:49:37.821853Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07047","last_updated":"2024-02-20T06:12:39Z","snapshot_observed_at":"2026-08-16T15:16:23.720505Z","submitted_at":"2023-07-13T20:02:50Z","title":"Does Collaborative Human-LM Dialogue Generation Help Information Extraction from Human Dialogues?","version":2},"cited_work":{"arxiv_id":"2307.07047","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.07047","snapshot_observed_at":"2026-08-04T20:49:38.421116Z","title":"Does Collaborative Human-LM Dialogue Generation Help Information Extraction from Human Dialogues?","venue":"cs.CL","work_id":"5fd232cb-f743-4152-bee4-3b5d368e8139","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.825035Z"},"links":{"cited_paper":"/paper/2307.07047","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:db2b348f46407dffbc2cf944eaefcd29b0e3046597d651ce06263ed449658780","observation_id":"2d5c61ac-b1b9-4897-b28f-e07023de6692","resolution":{"observed_at":"2026-08-04T20:49:38.424776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T20:49:37.828512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.828512Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:58072a24213bcc811e9b3037d7afec5291e0894e2ada4437de708fed33c135d0","observation_id":"471b3a71-5314-4d8c-92b9-b09b593b1b8c","resolution":{"observed_at":"2026-08-04T20:49:37.828512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.807253Z","title":null,"venue":null,"work_id":"6044c4cb-24a1-4a86-b7a4-d7af3f15ee40","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.831676Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d45874aa474b0e8b6492dc8550e7c4a2886f345356cf197d5dd60dbf4443f5bc","observation_id":"49b0f118-b64e-4178-9d88-ddb33e141722","resolution":{"observed_at":"2026-08-04T20:49:38.810473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.608.url:http:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.071722Z","title":"Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models","venue":null,"work_id":"82442691-e7fb-4771-ab26-df2db4acbceb","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.834886Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:5564bc6b7331d407b7c1e627d6c1389f611b44ce123e66d796754387da646184","observation_id":"19340d35-d8dc-492b-a01e-da2c002f59f8","resolution":{"observed_at":"2026-08-04T20:49:38.075453Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10299","last_updated":"2025-02-14T17:01:06Z","snapshot_observed_at":"2026-08-13T13:33:29.947977Z","submitted_at":"2025-02-14T17:01:06Z","title":"Open-Source AI-Powered Optimization in Scalene: Advancing Python Performance Profiling with DeepSeek-R1 and LLaMA 3.2","version":1},"cited_work":{"arxiv_id":"2502.10299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10299","snapshot_observed_at":"2026-08-04T20:49:38.396785Z","title":"Open-Source AI-Powered Optimization in Scalene: Advancing Python Performance Profiling with DeepSeek-R1 and LLaMA 3.2","venue":"cs.PL","work_id":"96dbd6a1-1427-4707-b68a-e652a7f5b106","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.838235Z"},"links":{"cited_paper":"/paper/2502.10299","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:314f4e57ba541b84d47b9abb761b8b952c04282418705ccb082b8bab53f7bb67","observation_id":"e0747679-0ef8-45fc-8748-90c167363d09","resolution":{"observed_at":"2026-08-04T20:49:38.400364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-15T21:48:04.229100Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-04T20:49:37.841831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.841831Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:523862b348a23650add162b4a5d2a6be4ddaa31439718b36555231a2da795702","observation_id":"962487d1-4a09-403b-9316-9085a2f737fb","resolution":{"observed_at":"2026-08-04T20:49:37.841831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.845804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.845804Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:07ff550a7a6139e09fb90daf123b32ad4407bf690089a14c780dac09550fcbe0","observation_id":"686ddd5b-ecaa-4113-8836-f4563aff8576","resolution":{"observed_at":"2026-08-04T20:49:37.845804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10938","last_updated":"2022-12-21T11:25:41Z","snapshot_observed_at":"2026-08-16T19:12:44.662067Z","submitted_at":"2022-12-21T11:25:41Z","title":"Critic-Guided Decoding for Controlled Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10938","snapshot_observed_at":"2026-08-04T20:49:37.849055Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.849055Z"},"links":{"cited_paper":"/paper/2212.10938","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:3a86f1df8161cbeecc8fef00ba720dcca5d9b91768cdb585cb3ed40b8cd26fa0","observation_id":"3949d292-4765-4560-832c-495e536ca763","resolution":{"observed_at":"2026-08-04T20:49:37.849055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.852560Z","title":"Reward modeling for mitigating toxicity in transformer- based language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.852560Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2f3979a0a816bd477ebc940fc3201bc563565d08d43a278321b98dd37b1267ef","observation_id":"a8ea7f94-81e9-4deb-96e4-6287b9e6be76","resolution":{"observed_at":"2026-08-04T20:49:37.852560Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-04T20:49:37.856497Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.856497Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9980aefa0223e3d09ba3d2f4b406e39a6620a5d70597394b8e978c39a58acb03","observation_id":"8b673578-115d-4b94-a7b6-5a32df5b2d83","resolution":{"observed_at":"2026-08-04T20:49:37.856497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-17T19:15:32.679249Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-04T20:49:37.860236Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.860236Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:3b4c0e1e702156a794b92a2ff8ec73a14be82eb9719d44b007886ce25982299a","observation_id":"5c83c194-5500-4e25-8fcd-2a01803b5c5d","resolution":{"observed_at":"2026-08-04T20:49:37.860236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-16T16:48:21.526954Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-04T20:49:37.863607Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.863607Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:96178f917b4439347173645613ae1a7ed00504bd28627673849469e30c42041a","observation_id":"c03c4cad-38a5-4fd7-b10b-54ea38f68ead","resolution":{"observed_at":"2026-08-04T20:49:37.863607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T20:49:37.867399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.867399Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1d9a45aeba72d50b4201874016abbd885e7f5ab7be85c15a334e41652ff393d0","observation_id":"390243b3-4aaf-49c1-a16e-221c9a50427c","resolution":{"observed_at":"2026-08-04T20:49:37.867399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-16T19:00:44.321598Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-04T20:49:37.871050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.871050Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:cedc34156d2a82a44ecc7bfc72c6eaf54035dc9a2c38966d59b3de300e605b73","observation_id":"328e2211-4bb1-46a9-81e1-360362a1d399","resolution":{"observed_at":"2026-08-04T20:49:37.871050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.796584Z","title":"2025.URL:https://openreview.net/forum? id=6y00rooi7i","venue":null,"work_id":"8f579925-0eb3-4935-98ce-f1101f451f1c","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.874812Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b2ed3ff9b045191f8ccfe2c362a8baafbafa5cc8b22b4c32be1954b993eff141","observation_id":"a0f5f510-9372-4477-8cdc-0e2fba197146","resolution":{"observed_at":"2026-08-04T20:49:38.799899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06025","last_updated":"2024-07-08T15:22:49Z","snapshot_observed_at":"2026-08-17T15:43:14.539186Z","submitted_at":"2024-07-08T15:22:49Z","title":"iLLM-TSC: Integration reinforcement learning and large language model for traffic signal control policy improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06025","snapshot_observed_at":"2026-08-04T20:49:37.878308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.878308Z"},"links":{"cited_paper":"/paper/2407.06025","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:08f4743a911f9b0faf5af8644ebfab18400c2bf0e4f3b974bb432f436c1fe3d7","observation_id":"7c42d6f5-becd-4159-bdfc-9ca99d52ee0a","resolution":{"observed_at":"2026-08-04T20:49:37.878308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.294067Z","title":"Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxon- omy, and Methods","venue":null,"work_id":"b06c56f5-2d5b-41ca-9e29-c861e58fd156","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.882153Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d3f1f591da3610f7ccbeac1bd9305ec6ac72126bb1f355b1db79cb6f841e0b00","observation_id":"7cf13e67-2e61-4feb-8c4c-2dafb40dba46","resolution":{"observed_at":"2026-08-04T20:49:38.299793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.785795Z","title":"Learning by Reusing Previous Advice in Teacher- Student Paradigm","venue":null,"work_id":"7cff0191-eb15-4201-9bb2-1209c55ff8a2","year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.885288Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:904a73d75ff4eaf7dc6651958a0e5e2a2b0d2ffe510262b58e635d136e123302","observation_id":"36150866-9739-4fc0-89e7-099a1d5f47f7","resolution":{"observed_at":"2026-08-04T20:49:38.789371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.774822Z","title":"Minigrid & miniworld: modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":"1ef2d3ef-cd36-4126-991f-9cc7004dd670","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.888834Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e0cd6992a80c9f1df1f467b0204e6adbbbb5809de68eec67efc2702bdd2c5fa7","observation_id":"04655b6d-2442-46b1-a37f-8cb5c2c79635","resolution":{"observed_at":"2026-08-04T20:49:38.778651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13202","last_updated":"2021-11-16T21:17:20Z","snapshot_observed_at":"2026-08-16T17:53:42.624427Z","submitted_at":"2021-09-27T17:22:42Z","title":"MiniHack the Planet: A Sandbox for Open-Ended Reinforcement Learning Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13202","snapshot_observed_at":"2026-08-04T20:49:37.891940Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.891940Z"},"links":{"cited_paper":"/paper/2109.13202","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d86579a8c4f5b18de96ef448261d0b688df7b7d0d26e403bb2eaa827c9e0e449","observation_id":"21d1212b-e624-4f07-9804-cbf5cdfcecbe","resolution":{"observed_at":"2026-08-04T20:49:37.891940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06780","last_updated":"2022-02-12T20:02:13Z","snapshot_observed_at":"2026-08-16T17:56:40.043488Z","submitted_at":"2021-09-14T15:49:31Z","title":"Benchmarking the Spectrum of Agent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06780","snapshot_observed_at":"2026-08-04T20:49:37.895334Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.895334Z"},"links":{"cited_paper":"/paper/2109.06780","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:218c055a04a8e886fe4f4381ed545ac609b20ff7a4c2c7f800c42058f3145b85","observation_id":"afd4d3b6-33c3-4d96-8c29-c5fe411cd001","resolution":{"observed_at":"2026-08-04T20:49:37.895334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05596","last_updated":"2023-11-09T18:54:28Z","snapshot_observed_at":"2026-08-16T14:44:33.661861Z","submitted_at":"2023-11-09T18:54:28Z","title":"LLM Augmented Hierarchical Agents","version":1},"cited_work":{"arxiv_id":"2311.05596","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05596","snapshot_observed_at":"2026-08-04T20:49:38.259372Z","title":"LLM Augmented Hierarchical Agents","venue":"cs.LG","work_id":"49831c8a-1c8a-48b5-9185-81363cb3f786","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.898683Z"},"links":{"cited_paper":"/paper/2311.05596","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9420f51e89d56604b603b8b82c93e96588f8de70b0041be1b93856d9ff03daee","observation_id":"251ee647-48b4-4447-bdd0-a77c3aaaf30a","resolution":{"observed_at":"2026-08-04T20:49:38.262797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.763352Z","title":"Teaching on a budget: agents advising agents in reinforcement learn- ing","venue":null,"work_id":"6685a50a-eb60-4945-84d5-38f92116827f","year":2013},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.902315Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:28b1a62463d0f31a4a801709a2ff2b37e1b564f85f971bd4376b078f873ba629","observation_id":"b0ec105d-082d-40bb-bc08-ef0c9092a0f0","resolution":{"observed_at":"2026-08-04T20:49:38.766821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.752728Z","title":"Simultaneously Learning and Advising in Multiagent Reinforcement Learning","venue":null,"work_id":"ecee3ea6-0cd9-4ada-b43c-a64c474d2f08","year":2017},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.905768Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:5ccbf8881b59446ae15ccbd2278484f69621bad60a17d80d971356cfe9a6d192","observation_id":"2db3009c-2e21-4587-a067-103389989162","resolution":{"observed_at":"2026-08-04T20:49:38.756087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-08-14T04:21:28.978034Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-04T20:49:37.908962Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.908962Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9fa02b81fc419b86ec0a37efbb3939fba31724dd4d4b0de0db1fdfaf7d6ae5e8","observation_id":"4708b46a-adca-41e8-a124-064c92278cf0","resolution":{"observed_at":"2026-08-04T20:49:37.908962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-04T20:49:37.912725Z","title":"Brown et al.Language Models are Few-Shot Learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.912725Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:33fae937c4d7e9e8dfce5de131d007ecb71e845bbbf4f02f60b960e2cdc9477d","observation_id":"df71067c-76a5-43fe-bd15-57f36c7c681f","resolution":{"observed_at":"2026-08-04T20:49:37.912725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-04T20:49:37.916750Z","title":"Cohen.Program of Thoughts Prompting: Dis- entangling Computation from Reasoning for Numerical Reasoning Tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.916750Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2fb2ef83349d33139beffd1d425503de9eee7b0df157c4638c660673c084a6ec","observation_id":"9ceff9e6-c61b-4420-a61f-2df51d321fd0","resolution":{"observed_at":"2026-08-04T20:49:37.916750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.742099Z","title":null,"venue":null,"work_id":"8e3df99c-9e07-4abd-b3c1-a518ff2352c3","year":null},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.920386Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:8598a439c9cc03af16f8247cf0974a8d4e39f11bcb42afc04d51d91594a4ef47","observation_id":"c388a109-cd3e-4377-9484-3db35a08d0b8","resolution":{"observed_at":"2026-08-04T20:49:38.745635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.731175Z","title":"Using Ollama","venue":null,"work_id":"d9e5c211-3c9f-4bfb-8318-ad28356b8bf8","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.927393Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:6425ab11097da9cd6d12f3838cad4afb782a7559cd1fe33fd5f5d584bc1b5cea","observation_id":"3fbc8c99-6316-40d1-a694-bf2e9412fe14","resolution":{"observed_at":"2026-08-04T20:49:38.734303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14826","last_updated":"2026-04-04T00:44:19Z","snapshot_observed_at":"2026-08-06T19:44:15.952593Z","submitted_at":"2024-10-18T18:51:44Z","title":"SPRIG: Improving Large Language Model Performance by System Prompt Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14826","snapshot_observed_at":"2026-08-04T20:49:37.930680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.930680Z"},"links":{"cited_paper":"/paper/2410.14826","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ed3f0d472b2a5ab0b3ae819438cd8217a8304c24a6ad682447b473d2bc100e01","observation_id":"8a031c54-11f9-43b3-9d6b-f8de9eb01719","resolution":{"observed_at":"2026-08-04T20:49:37.930680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-04T20:49:37.933858Z","title":"Schmidt.A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.933858Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a56307b5430ba98a2024baedc5555abc862b567414e251f9406d1a94b1ddc90c","observation_id":"dc7b8055-0f57-4de5-ac93-93d04dc9001c","resolution":{"observed_at":"2026-08-04T20:49:37.933858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T20:49:37.937179Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.937179Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:aebea204f220edb31a9874a94995d4e14e7b859b550f656d8d2e7f048938475f","observation_id":"b19d0852-b7a0-48af-b8f5-a59931772fc7","resolution":{"observed_at":"2026-08-04T20:49:37.937179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17752","last_updated":"2025-05-14T12:22:01Z","snapshot_observed_at":"2026-08-16T12:58:19.450800Z","submitted_at":"2025-01-29T16:41:15Z","title":"On the Partitioning of GPU Power among Multi-Instances","version":2},"cited_work":{"arxiv_id":"2501.17752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17752","snapshot_observed_at":"2026-08-04T20:49:38.178193Z","title":"On the Partitioning of GPU Power among Multi-Instances","venue":"cs.DC","work_id":"c6f15619-b7b1-4b3f-855c-c09752f722ba","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.940585Z"},"links":{"cited_paper":"/paper/2501.17752","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c7c42d0c3aa0e3d8facc1fb23fb0ff182869cb7ab50c60a7fac702db8be0edfe","observation_id":"7d6491d8-6382-46ce-8df1-de2c91c42dc9","resolution":{"observed_at":"2026-08-04T20:49:38.182311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T20:49:37.943759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.943759Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1c27bbd8e7b97af700c3548183b8535fdb038cc2c86f341eace0e38f83ec1fab","observation_id":"9ca0dc91-adc6-4ea1-84c7-35e27eeb421f","resolution":{"observed_at":"2026-08-04T20:49:37.943759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01727","last_updated":"2023-08-03T12:36:13Z","snapshot_observed_at":"2026-08-16T15:11:03.626690Z","submitted_at":"2023-08-03T12:36:13Z","title":"Local Large Language Models for Complex Structured Medical Tasks","version":1},"cited_work":{"arxiv_id":"2308.01727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.01727","snapshot_observed_at":"2026-08-04T20:49:38.153635Z","title":"Local Large Language Models for Complex Structured Medical Tasks","venue":"cs.CL","work_id":"c811046c-9a5f-40ee-8450-bf3332728af5","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.947200Z"},"links":{"cited_paper":"/paper/2308.01727","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:7fa5e436ddb62a116e2305f3ce02b9244f43052b35178e1119f3b0cd3cb7695b","observation_id":"839ed5fb-3ec6-4362-8bc4-6d1680a95ca0","resolution":{"observed_at":"2026-08-04T20:49:38.157716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s43856-025-00808-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.052161Z","title":"Comprehensive testing of large language models for extraction of structured data in pathology","venue":null,"work_id":"f239448d-05f3-48b3-9a48-6f7cc06bd502","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.950968Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:53e980a066546952a5e140afe511940f34fd9e828cd734db5455e9803c5afb8a","observation_id":"fb9bfbc1-5c07-4cf1-964a-569affae9c8b","resolution":{"observed_at":"2026-08-04T20:49:38.055904Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T17:46:46.990002Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":5,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":71,"verified_exact":10,"verified_fuzzy":10},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 0 inbound Pith citation observations for arXiv:2509.08329."}