{"as_of":"2026-08-16T17:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0473324b9b1e0d7226ad59b8dce9c242690a3092f02475fd38280932ba288289","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:05:21.477420Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:25:37.918588Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"cited_work":{"arxiv_id":"2505.10861","doi":"10.48550/arxiv.2505.10861","metadata_source":"pith","pith_arxiv_id":"2505.10861","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","venue":"cs.LG","work_id":"64f5173f-6c73-4318-84d7-ef9ceafa6f88","year":2025},"citing_paper":{"arxiv_id":"2608.06015","last_updated":"2026-08-06T13:19:29Z","snapshot_observed_at":"2026-08-14T07:26:10.870949Z","submitted_at":"2026-08-06T13:19:29Z","title":"ProDVI: Programmatic Dynamics Priors for Value Network Initialization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:37.918588Z"},"links":{"cited_paper":"/paper/2505.10861","citing_paper":"/paper/2608.06015"},"observation_digest":"sha256:32a8b6f17704c41ae92c41c2d4a6650790d91eb06ae9648ad19c5b0e8358fed8","observation_id":"f2d30702-5654-451e-a9d5-872b374fdef9","resolution":{"observed_at":"2026-08-07T19:25:38.695370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10861/citation-record","integrity":"/paper/2505.10861/integrity","json":"/paper/2505.10861/citation-record.json","paper":"/paper/2505.10861"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.06129","last_updated":"2021-09-14T07:10:41Z","snapshot_observed_at":"2026-08-13T18:12:39.767729Z","submitted_at":"2021-09-13T17:09:40Z","title":"Can Language Models Encode Perceptual Structure Without Grounding? A Case Study in Color","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06129","snapshot_observed_at":"2026-08-15T21:05:21.202033Z","title":"Can language models encode perceptual structure without grounding? a case study in color","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.202033Z"},"links":{"cited_paper":"/paper/2109.06129","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:7207f90e86cfe7d0366fb07d05fe66fbea9e90b4202d115e25b0566599b2c55e","observation_id":"500b0b05-6bbd-4c6d-b30e-4e3099c7708f","resolution":{"observed_at":"2026-08-15T21:05:21.202033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.208253Z","title":"Reinforcement learning: Theory and algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.208253Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:bd6ef6af6439602361b181f398ee0df74110ab06807a472bf593e699cf6bc562","observation_id":"945fb16b-7968-456a-8893-509d74674454","resolution":{"observed_at":"2026-08-15T21:05:21.208253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T21:05:21.213425Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.213425Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:42c0b1e83c6141a6b13a4888956ef4f88eb9d0aabfa0f1702b07cd325594db5c","observation_id":"f975919c-8866-4ea1-8313-1a83144506b7","resolution":{"observed_at":"2026-08-15T21:05:21.213425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08226","last_updated":"2020-11-05T23:10:28Z","snapshot_observed_at":"2026-08-14T16:13:12.694749Z","submitted_at":"2019-06-19T17:16:46Z","title":"Unsupervised State Representation Learning in Atari","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08226","snapshot_observed_at":"2026-08-15T21:05:21.218302Z","title":"Unsupervised state representation learning in atari","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.218302Z"},"links":{"cited_paper":"/paper/1906.08226","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:087e3ff7d903c1c658638e6ce1a46e31e90d47639e2d5134ccd9050cc339c43f","observation_id":"807bbdff-39eb-47b5-aca6-892ea3e9b929","resolution":{"observed_at":"2026-08-15T21:05:21.218302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.224310Z","title":"Griffiths","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.224310Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:7fed862fdba6543216b4d56c937a1f3659f0fd938076480706f206d610ef613d","observation_id":"e7b764f1-0e47-4bab-bbae-5429a9dd66e3","resolution":{"observed_at":"2026-08-15T21:05:21.224310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-08-16T15:57:20.569621Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-15T21:05:21.229109Z","title":"Ball, Laura Smith, Ilya Kostrikov, and Sergey Levine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.229109Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:834626094c6cff1967393c7bc7af070f7e9baf49db67c464ad9d38de5f0abf39","observation_id":"d6c5c746-9aae-4a49-8511-fc163fa3c56f","resolution":{"observed_at":"2026-08-15T21:05:21.229109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.383729Z","title":"Neuro-dynamic programming: An overview and recent results","venue":null,"work_id":"c8d8d801-5b2d-4d9d-adf5-a071a086b03b","year":2006},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.234720Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:c81d336fc5add14531fef817b9ec374a94f8cecacc2679d2870b06455f225608","observation_id":"1e92dbc5-5abb-4937-9fbe-2a8046b82339","resolution":{"observed_at":"2026-08-15T21:05:22.388449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.239027Z","title":"Grounding llms for robot task planning using closed-loop state feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.239027Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:afcabf96f01a84aac61a3a78d1060a3310f32127361d0880976b564694610ac8","observation_id":"aecc0872-0d13-4558-85bb-7a2e79c1f3e8","resolution":{"observed_at":"2026-08-15T21:05:21.239027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.243611Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.243611Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:8690c7264e655944c8a3de2fc84c2c79f2a5507d0ed652b681064055f8d42b28","observation_id":"7012707f-78d1-4f4a-a0c8-7bf0b23ccd7f","resolution":{"observed_at":"2026-08-15T21:05:21.243611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.360692Z","title":"Grounding large language models in interactive environments with online reinforcement learning","venue":null,"work_id":"a2b33058-1cd6-498d-81f2-fcf055041aba","year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.248737Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:99860d9dcf7c5fd416fa854021274f5e95112816c725526ed562d5742d6bdf0d","observation_id":"803e20cd-edfe-4994-ba6e-0f4f88ca2145","resolution":{"observed_at":"2026-08-15T21:05:22.365281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12125","last_updated":"2025-06-15T04:49:56Z","snapshot_observed_at":"2026-08-16T13:42:02.554042Z","submitted_at":"2024-06-17T22:13:22Z","title":"Efficient Sequential Decision Making with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12125","snapshot_observed_at":"2026-08-15T21:05:21.253125Z","title":"Efficient sequential decision making with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.253125Z"},"links":{"cited_paper":"/paper/2406.12125","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:7ffa1b2aaaf712e6deddd1abe7a58143ea16c10d3480862880b06405d3496213","observation_id":"6af3f052-b3ce-4e7d-bc9b-6e9753567a0c","resolution":{"observed_at":"2026-08-15T21:05:21.253125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12530","last_updated":"2022-10-22T19:09:18Z","snapshot_observed_at":"2026-08-16T16:21:58.173222Z","submitted_at":"2022-10-22T19:09:18Z","title":"LMPriors: Pre-Trained Language Models as Task-Specific Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12530","snapshot_observed_at":"2026-08-15T21:05:21.257799Z","title":"Lmpriors: Pre-trained language models as task-specific priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.257799Z"},"links":{"cited_paper":"/paper/2210.12530","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:1d71018ee5f2f01036379ff9a710511b4c322900146954c3bf3680df43d9f39a","observation_id":"8efc4fdf-dced-47c6-98b7-1a849c8ff17c","resolution":{"observed_at":"2026-08-15T21:05:21.257799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01534","last_updated":"2024-05-02T17:59:31Z","snapshot_observed_at":"2026-08-16T13:55:51.553203Z","submitted_at":"2024-05-02T17:59:31Z","title":"Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01534","snapshot_observed_at":"2026-08-15T21:05:21.262506Z","title":"Plan-seq-learn: Language model guided rl for solving long horizon robotics tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.262506Z"},"links":{"cited_paper":"/paper/2405.01534","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:9b9b1ace3a344cf13ff1aedfa8d1a29314fc002189ea46063d48bc7054191f07","observation_id":"74d1beda-5d17-4ad2-8bc7-b22490e7fa56","resolution":{"observed_at":"2026-08-15T21:05:21.262506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.267546Z","title":"Guiding pretraining in reinforcement learning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.267546Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:cf965d92121e911478b71e5d4ed625d99f3bae56221d1c5a5de434126ef9d197","observation_id":"086f8a74-0640-4fcc-b6fb-0ee254267183","resolution":{"observed_at":"2026-08-15T21:05:21.267546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.272038Z","title":"Tree-based batch mode reinforcement learning","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.272038Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:9222545f10ac83fded45f232b246c15ff0bc98821e86b810731699f170a85231","observation_id":"04171026-0468-4cc0-952c-e7e85607e395","resolution":{"observed_at":"2026-08-15T21:05:21.272038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-15T21:05:21.276339Z","title":"Soft actor-critic algorithms and applications, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.276339Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:4482240385be8b4bb06467014b760695e2adf5503b171c915a98ed6b939871cb","observation_id":"a48a4f33-20fb-4817-8add-79a50cc727b9","resolution":{"observed_at":"2026-08-15T21:05:21.276339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12112","last_updated":"2025-07-09T16:13:20Z","snapshot_observed_at":"2026-08-16T13:09:00.191163Z","submitted_at":"2024-10-15T23:20:54Z","title":"Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized Programming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12112","snapshot_observed_at":"2026-08-15T21:05:21.281529Z","title":"Planning anything with rigor: General-purpose zero-shot planning with llm-based formalized programming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.281529Z"},"links":{"cited_paper":"/paper/2410.12112","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:e5753e59e54481ebb334aafd0f495c653dc1e783c3efef47cc1b9249f123bd05","observation_id":"faa31b6e-e34a-4756-9890-4308bb567c7e","resolution":{"observed_at":"2026-08-15T21:05:21.281529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.286683Z","title":"Deep q-learning from demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.286683Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:b2db22968debbffda8728da2f8163498b8ade7c8feaa54bde9b970c5a46a2c58","observation_id":"e564af48-2bb2-4c83-a939-f96492fa3324","resolution":{"observed_at":"2026-08-15T21:05:21.286683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.291172Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.291172Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:f0c9bac3b29d46d4a26208a405e566bf9815f69756ef402442bcda785c76f384","observation_id":"8ca3dfa6-a5f3-482e-a43a-1373fbd0dd2c","resolution":{"observed_at":"2026-08-15T21:05:21.291172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T21:05:21.295393Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.295393Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:1423bce26807a1b291bd169d17cc1c041dd407599a8a86d09ba835f83bae5f87","observation_id":"6f6fa83f-5aa2-4d06-8703-9c123f6831af","resolution":{"observed_at":"2026-08-15T21:05:21.295393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.309966Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"69626f1e-ee16-4806-ba5b-c95aa9804f5a","year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.299703Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:da6569963cea2152231209f46750e50f19e534b987ba9c197192ace4d49b7f8e","observation_id":"d578f68d-f64b-4130-8c0b-34a273fc3554","resolution":{"observed_at":"2026-08-15T21:05:22.314781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-15T21:05:21.304138Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.304138Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:27c262728fc787484703c6728cf4a399575c963ed0c6cc0ef47758174324f681","observation_id":"adfed43b-9118-4cf9-b9ca-0b365f91c080","resolution":{"observed_at":"2026-08-15T21:05:21.304138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.308472Z","title":"A survey of robot intelligence with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.308472Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:67ec4dc2aaed09999c6a77559d7e4903ca048b6337c418df04a3bfa3a53f7a6d","observation_id":"97f35f64-43b2-4862-b800-030416b775f9","resolution":{"observed_at":"2026-08-15T21:05:21.308472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.295388Z","title":"Bench llm deciders with gym translators","venue":null,"work_id":"6d7f4884-17f5-4fe8-a84d-f7b858b36ee4","year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.313022Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:6cc2411ac19a0f26ed8b554e28799279b58428423a4bead9a419edf8ae19ae7a","observation_id":"9ade9eef-bd05-4d06-82a1-7e3fd16b17a6","resolution":{"observed_at":"2026-08-15T21:05:22.300138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.280742Z","title":"Housekeep: Tidying virtual households using commonsense reasoning","venue":null,"work_id":"9c1b044d-d478-4023-9b63-944883ceb4dc","year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.317283Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:837fb60e31fc3f88134e3ed2b2307b51e9db4d905ee740926dde59746beee14d","observation_id":"aa5fcee6-4bf2-4b9f-a749-6241563b3065","resolution":{"observed_at":"2026-08-15T21:05:22.285482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.321708Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.321708Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:d8a726ce22eaed30d72fbdf789adff50535b71de3aa2f8917f58d9f79cddf19d","observation_id":"a3311083-fba8-45a7-b497-08972e02ca09","resolution":{"observed_at":"2026-08-15T21:05:21.321708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-08-16T14:07:15.383490Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-15T21:05:21.325869Z","title":"Can large language models explore in-context? arXiv preprint arXiv:2403.15371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.325869Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:48c93ada6de31c8cbe4e2f610fa8ac20ca2a05b804c328c7185fc548b722324a","observation_id":"0fa4467a-407f-4a72-b660-81f06ff2e7fc","resolution":{"observed_at":"2026-08-15T21:05:21.325869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.330290Z","title":"Batch reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.330290Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:0fd3c43200248f8dce3ea5cb234d9c05993a64d2b4ef9473f65e5736134f5b36","observation_id":"d236be72-1f30-400a-b6f9-fc799da41d2f","resolution":{"observed_at":"2026-08-15T21:05:21.330290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.335032Z","title":"Supervised pretraining can learn in-context reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.335032Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:92f186309f9c04ab3f2e73d9f7b680e25aa27c875d85bba297ffd2f12d51a792","observation_id":"41565e31-b181-4d8e-9d97-25c573350a16","resolution":{"observed_at":"2026-08-15T21:05:21.335032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T21:05:21.339425Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.339425Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:92cc102f30be4fb633251e34f8f5337a74fe485630afac3614bbfdbe49e971ca","observation_id":"6bc88d04-51be-41ef-98bd-feb84b348992","resolution":{"observed_at":"2026-08-15T21:05:21.339425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.344099Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.344099Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:114608e5e0527b7f5eae34cfed004bb44edd561168e87fa18a91b87d7ffa15bd","observation_id":"1ac0219f-c239-4f1d-b07b-1b8156ccb9f4","resolution":{"observed_at":"2026-08-15T21:05:21.344099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08566","last_updated":"2024-05-26T04:55:19Z","snapshot_observed_at":"2026-08-16T14:52:35.184770Z","submitted_at":"2023-10-12T17:55:02Z","title":"Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08566","snapshot_observed_at":"2026-08-15T21:05:21.348912Z","title":"Transformers as decision makers: Provable in-context reinforcement learning via supervised pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.348912Z"},"links":{"cited_paper":"/paper/2310.08566","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:5ab00fa391cf2099c29838e75a239dafadd4e6ea3d2bb9dbcdb5b8ae583c5393","observation_id":"a90147ac-36aa-4152-be0b-12e7a0655000","resolution":{"observed_at":"2026-08-15T21:05:21.348912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.231659Z","title":"Physgen: Rigid-body physics-grounded image-to-video generation","venue":null,"work_id":"2d3b790a-dfee-4802-8ef2-5b89280dd306","year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.353765Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:bda5939c1b6cf19aab35e96490559f85cca58b015182a2493c376fdd0da14708","observation_id":"07649708-e6e6-45e2-82aa-4f5d76599e6d","resolution":{"observed_at":"2026-08-15T21:05:22.236332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03926","last_updated":"2019-06-10T12:17:45Z","snapshot_observed_at":"2026-08-14T16:18:11.174755Z","submitted_at":"2019-06-10T12:17:45Z","title":"A Survey of Reinforcement Learning Informed by Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.03926","snapshot_observed_at":"2026-08-15T21:05:21.358359Z","title":"A survey of reinforcement learning informed by natural language","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.358359Z"},"links":{"cited_paper":"/paper/1906.03926","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:379ee1a80041b94564dd29d16c4e9548adfa838d7294f03aa0cfcd607a54a776","observation_id":"576cefc7-e47d-47c8-aff9-632f26c4d459","resolution":{"observed_at":"2026-08-15T21:05:21.358359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-15T21:05:21.363027Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.363027Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:46a557b49dfaf4b21855c79e438ff168023823921bc5316274fa829ae054edf8","observation_id":"be556654-9cbb-4619-8a4f-accd09f8c760","resolution":{"observed_at":"2026-08-15T21:05:21.363027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.367902Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.367902Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:a634dbfc7b4b81e872023e897b7847497f7adf833f48c44045d33b314bb0ef50","observation_id":"2db7ad14-22a4-48dc-bccd-84606c27c9b8","resolution":{"observed_at":"2026-08-15T21:05:21.367902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-15T21:05:21.372358Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.372358Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:a671dd6278bd563443e0bdf9e89e976e3e4326ff2483421cc88aec264d6c4059","observation_id":"52fc9b45-c769-42c5-8c02-f35e96739d8b","resolution":{"observed_at":"2026-08-15T21:05:21.372358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-08-16T13:11:24.472786Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-15T21:05:21.377077Z","title":"Evolve: Evaluating and optimizing llms for exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.377077Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:8942b161b396d101d115e229441cc21dd9e22d76e61d8e0832ee08d346285ce0","observation_id":"e94f63ce-d0b5-400a-a8e0-1f0595fdf8e8","resolution":{"observed_at":"2026-08-15T21:05:21.377077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.207675Z","title":"Llamagym: Fine-tune llm agents with online reinforcement learning","venue":null,"work_id":"f7fe56f0-5701-4be8-a339-e14c5a5ff78e","year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.381607Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:deb335da52907a43ffab8367d879e1cdcda4d6ca4271917f2520669b2392c1f2","observation_id":"d095b5cb-644b-4028-8449-86f33522ddb5","resolution":{"observed_at":"2026-08-15T21:05:22.213175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.385866Z","title":"Mapping language models to grounded conceptual spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.385866Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:cb3086dc9e2cdbc9b12ae545a21d9d9cad376621cb13e9cedb526fcf1c88306c","observation_id":"6db3aedd-05f8-478f-af60-1ef3638e7622","resolution":{"observed_at":"2026-08-15T21:05:21.385866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.10870","last_updated":"2021-04-12T08:53:38Z","snapshot_observed_at":"2026-08-13T21:46:20.515603Z","submitted_at":"2020-08-25T07:59:20Z","title":"Deep Q-Learning: Theoretical Insights from an Asymptotic Analysis","version":2},"cited_work":{"arxiv_id":"2008.10870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.10870","snapshot_observed_at":"2026-08-15T21:05:21.688490Z","title":"Deep Q-Learning: Theoretical Insights from an Asymptotic Analysis","venue":"cs.LG","work_id":"f0a0e624-c4fa-4da2-8068-87dbc7811a38","year":2020},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.390484Z"},"links":{"cited_paper":"/paper/2008.10870","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:d440463f255dc820120c9d1b2fe64d2799122ee9369bec3e6f79627cf97ec025","observation_id":"e3d43e25-5807-4d58-a31f-eca6ac07c11c","resolution":{"observed_at":"2026-08-15T21:05:21.695486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.182714Z","title":"Neural fitted q iteration--first experiences with a data efficient neural reinforcement learning method","venue":null,"work_id":"f94c1efc-1197-4c26-b668-a54971941535","year":2005},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.395272Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:096787b3bea4f1aa3e74fdef2e8b05d6d8f63c4cca618e6d8f18a40a1ae3f2f5","observation_id":"92b22de6-bf68-4b0e-bc43-45cd26ac1e31","resolution":{"observed_at":"2026-08-15T21:05:22.187685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-08-14T19:37:32.915923Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-15T21:05:21.399556Z","title":"Kickstarting deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.399556Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:9bcb221f57d6fd64144a970605b48c6fc68c5019ef930e2999a489b535ad446f","observation_id":"f695cd43-3bd0-4c65-80d6-19a3efb495fb","resolution":{"observed_at":"2026-08-15T21:05:21.399556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.404084Z","title":"d3rlpy: An offline deep reinforcement learning library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.404084Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:2cf7424f693155b3a8e049dda643fd443f7205f35627c88efe17830f30997b6c","observation_id":"dd8f0dfc-628e-46a6-a737-0f46f2607295","resolution":{"observed_at":"2026-08-15T21:05:21.404084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.408938Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.408938Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:b1d8ee5233d6cd29ab07fc13559f5d0deb1ffb4ce4bc47b7d3b493857b13aca5","observation_id":"b0e751dd-a5ec-47a2-ac7f-a1c8ee1cecf4","resolution":{"observed_at":"2026-08-15T21:05:21.408938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13508","last_updated":"2025-03-13T19:42:04Z","snapshot_observed_at":"2026-08-16T12:50:14.401336Z","submitted_at":"2025-03-13T19:42:04Z","title":"It is Too Many Options: Pitfalls of Multiple-Choice Questions in Generative AI and Medical Education","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13508","snapshot_observed_at":"2026-08-15T21:05:21.413563Z","title":"It is too many options: Pitfalls of multiple-choice questions in generative ai and medical education, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.413563Z"},"links":{"cited_paper":"/paper/2503.13508","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:4f27d50776196d85666783ffd343b6751b607ab421dc0c4421e74371a398f61c","observation_id":"97cc27ab-56ac-4efe-8d15-7e70b2245994","resolution":{"observed_at":"2026-08-15T21:05:21.413563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-16T16:24:37.265288Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-15T21:05:21.418269Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.418269Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:199bcd62312b69efbc5b845727a676d3765e14f1e05a360a9b3aca02eda3c13b","observation_id":"143dc137-5a88-49bb-ae91-a05c169d57b4","resolution":{"observed_at":"2026-08-15T21:05:21.418269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14151","last_updated":"2024-03-11T03:15:58Z","snapshot_observed_at":"2026-08-16T14:24:34.824089Z","submitted_at":"2024-01-25T13:03:20Z","title":"True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14151","snapshot_observed_at":"2026-08-15T21:05:21.423074Z","title":"True knowledge comes from practice: Aligning llms with embodied environments via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.423074Z"},"links":{"cited_paper":"/paper/2401.14151","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:d0a7e65527025cf6825592c66560a2ec31f71413f456995caed1c8481bdfa0f2","observation_id":"8a37a8d8-fd26-42ef-aa7e-625726d1c3a1","resolution":{"observed_at":"2026-08-15T21:05:21.423074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-15T21:05:21.427700Z","title":"Gymnasium: A standard interface for reinforcement learning environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.427700Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:aa9b3db89590a068b3198fcaa64dfc44d3164d1b9765d40edc23d09ad2338e8f","observation_id":"3e024e96-912d-454a-80e5-b4b9abfacfc5","resolution":{"observed_at":"2026-08-15T21:05:21.427700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04652","last_updated":"2022-01-06T04:33:56Z","snapshot_observed_at":"2026-08-13T17:56:02.834743Z","submitted_at":"2021-10-09T22:04:34Z","title":"Representation Learning for Online and Offline RL in Low-rank MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04652","snapshot_observed_at":"2026-08-15T21:05:21.432391Z","title":"Representation learning for online and offline rl in low-rank mdps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.432391Z"},"links":{"cited_paper":"/paper/2110.04652","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:eca3d42f1208aaa9e50735d70c4a5ddee507481cbb01c7a109fa31aef81add99","observation_id":"6dcd2c35-d5d6-4a16-ad07-9515d53786e3","resolution":{"observed_at":"2026-08-15T21:05:21.432391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-14T22:31:25.126692Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-15T21:05:21.437109Z","title":"Deep reinforcement learning with double q-learning, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.437109Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:677e48ef18f2977cf19e8e89a585fa628476d1b68023e8374982eff269d39b85","observation_id":"a59c1136-1d1b-4ce4-8d72-2b6a99b53dbd","resolution":{"observed_at":"2026-08-15T21:05:21.437109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.149006Z","title":"Instabilities of offline rl with pre-trained neural representation","venue":null,"work_id":"f583f26e-8b93-4d2f-b2da-87ac63048058","year":2021},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.441831Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:908f20501da5d579f3e2150b88e3f605ce7d30ea3d6e62b42337e6a39b4e06ff","observation_id":"0d28139d-0e1b-4166-b820-945784beb028","resolution":{"observed_at":"2026-08-15T21:05:22.153897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:21.445957Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.445957Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:029e9188c6dd1abae08a836e1a363a08e6ec4bc6e67bfbfbe792237fcd7e8a48","observation_id":"1b2f8424-0178-4a98-a6f5-b7161f2540a6","resolution":{"observed_at":"2026-08-15T21:05:21.445957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.124757Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":"823544ed-302c-41a8-81eb-3742854990e9","year":2021},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.450587Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:19d48631551bd3bb158dc6d9a9867df9012acc14e2830dab967c6ddb770b8ef1","observation_id":"c4e53891-9749-4d06-a701-4061e7827b72","resolution":{"observed_at":"2026-08-15T21:05:22.129447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-16T14:59:02.373142Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-15T21:05:21.454824Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.454824Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:4ea417fbc0229e1c9d2cdf39574e9103ea393efd52448550bf9e89210b96f967","observation_id":"a61e155c-1586-4e41-af76-13ed7df7292f","resolution":{"observed_at":"2026-08-15T21:05:21.454824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:05:21.459606Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.459606Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:8267cd3e81612f2f58ebb8ece9ddedf0b579b0ea66b30a73dd7e461f94657efc","observation_id":"bd68ada6-c12b-441e-8fe8-4b81eb54573e","resolution":{"observed_at":"2026-08-15T21:05:21.459606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-15T21:05:21.463838Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.463838Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:444cb97d30effac04ab1c5b67dcf3119439a686ef4d94bed3860235d1aa29e6c","observation_id":"9b2129aa-1500-4fb9-b8a8-401021eb3933","resolution":{"observed_at":"2026-08-15T21:05:21.463838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.108515Z","title":"Policy finetuning in reinforcement learning via design of experiments using offline data","venue":null,"work_id":"cab99036-1d5a-4566-ae6f-865e490ea695","year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.468622Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:406ee6bccfebf196107e2d63a9ca6c4148d5dea2c211f31645e3e28143c97ed6","observation_id":"41044195-3ce1-4045-a71f-decbeb0082d3","resolution":{"observed_at":"2026-08-15T21:05:22.114177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:22.093086Z","title":"Online decision transformer","venue":null,"work_id":"bc3b5433-d7f0-4394-9c38-a428bbefbc93","year":2022},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.472787Z"},"links":{"citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:5733c5eb790d2596f9bd4b32780c7c5bd7a3034ea872e0c468c38a87af1afc42","observation_id":"a4504fb6-8505-49b8-b05a-66dc89d85d30","resolution":{"observed_at":"2026-08-15T21:05:22.097815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-13T11:34:11.989911Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-08-15T21:05:21.477420Z","title":"Language agent tree search unifies reasoning acting and planning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T21:05:21.477420Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2505.10861"},"observation_digest":"sha256:4b7d0c419b6296808081fa735721c28944c55da3f428b647c276be65260db223","observation_id":"2e7e81b9-3538-4909-9f76-5aa26cd04b72","resolution":{"observed_at":"2026-08-15T21:05:21.477420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10861","last_updated":"2025-05-16T05:03:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:59:49.266877Z","submitted_at":"2025-05-16T05:03:39Z","title":"Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2505.10861."}