{"as_of":"2026-08-11T17:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0044ab6a45776fa7a8d39c900f40fa45cf8753f1a2c750977a6ab1e64b3dbb0","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:18:58.530774Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:18:58.266458Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T20:18:59.380251Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"cited_work":{"arxiv_id":"2501.08925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.08925","snapshot_observed_at":"2026-08-10T20:18:59.380251Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","venue":"cs.LG","work_id":"f4a91344-88be-43c7-9c45-4a787ea7d238","year":2025},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.266458Z"},"links":{"cited_paper":"/paper/2501.08925","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:3caff73d7005ff4531e9a34082f8ea4ce58f36d0bf713d7aef8c6f963d9448b3","observation_id":"fa4690cf-90ec-4c9a-9a49-e4cb0294a079","resolution":{"observed_at":"2026-08-10T20:18:59.385875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08925/citation-record","integrity":"/paper/2501.08925/integrity","json":"/paper/2501.08925/citation-record.json","paper":"/paper/2501.08925"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1703.01732","last_updated":"2017-03-06T05:51:42Z","snapshot_observed_at":"2026-08-09T14:19:09.221373Z","submitted_at":"2017-03-06T05:51:42Z","title":"Surprise-Based Intrinsic Motivation for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01732","snapshot_observed_at":"2026-08-10T20:18:58.173568Z","title":"Achiam and S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.173568Z"},"links":{"cited_paper":"/paper/1703.01732","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:42e8681cd1fc759437b0e856fa180155f21ad96a099431fd05bd6c8bc2b24259","observation_id":"3c89830e-10d2-4c37-a231-a2a07db3797d","resolution":{"observed_at":"2026-08-10T20:18:58.173568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T20:18:58.179775Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.179775Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:e0607298154ddae30676e0dcd23d21eaa801a20c5cfe2c8bce1261f6291d8062","observation_id":"874763f3-8e68-4487-8ec9-6e6b1e88c452","resolution":{"observed_at":"2026-08-10T20:18:58.179775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.793610Z","title":null,"venue":null,"work_id":"d67333e7-b842-47c4-b8b7-77eaf058a688","year":null},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.185892Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:6cec5b4f9c00d6148e0035bfe70f2950c5691e3b91f11e2127cbdae2ef5fd628","observation_id":"a32f13e5-e1e4-4c02-9dfe-fd2616a85bcd","resolution":{"observed_at":"2026-08-10T20:18:59.798920Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.760254Z","title":null,"venue":null,"work_id":"b7d11221-b552-41f6-829f-56c70618e7a1","year":null},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.196787Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:3b070b154acd0af1d9821d90bc6fa6ba79fcb95aa38fe13cfae72be9ef65da60","observation_id":"0e8f0cb4-ded5-4b0e-949a-fed2354d680c","resolution":{"observed_at":"2026-08-10T20:18:59.765360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.743113Z","title":"Claude 3.5 Sonnet","venue":null,"work_id":"df6fac80-c991-41b7-87a1-4c12c43448cf","year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.207925Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:773cb56e5864d06b35464adad45ae54ac894d69fd711c0cc9061ce8acf25cfba","observation_id":"9b49b0bd-d869-49cd-8799-23cd752ef79b","resolution":{"observed_at":"2026-08-10T20:18:59.749185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.776473Z","title":null,"venue":null,"work_id":"5afd039d-e1db-4efe-bcbf-a5bb96aecc90","year":2025},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.202791Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f1e67179ca8180d7b214fe1f2165c40936589043b6a5d9fc154b49d6254ad056","observation_id":"1f53e069-f486-444b-afd7-614d579c7beb","resolution":{"observed_at":"2026-08-10T20:18:59.782006Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:58.220781Z","title":"Bellemare, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.220781Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:eb55f6dcc3d33345c226a82c46fff27eb4e3db98e34b12f7087c6b738e81f35d","observation_id":"9c4dc64a-6f48-4590-ac21-b9a8c12a10f2","resolution":{"observed_at":"2026-08-10T20:18:58.220781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.2874","last_updated":"2012-06-30T08:17:09Z","snapshot_observed_at":"2026-08-03T16:37:30.251287Z","submitted_at":"2012-05-13T15:11:00Z","title":"Decoupling Exploration and Exploitation in Multi-Armed Bandits","version":3},"cited_work":{"arxiv_id":"1205.2874","doi":null,"metadata_source":"pith","pith_arxiv_id":"1205.2874","snapshot_observed_at":"2026-08-10T20:18:59.478981Z","title":"Decoupling Exploration and Exploitation in Multi-Armed Bandits","venue":"cs.LG","work_id":"2cf2aecc-7582-42e2-a9cd-4dd42c1e59cd","year":2012},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.214412Z"},"links":{"cited_paper":"/paper/1205.2874","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f2e24e36c34842fd0607dcb9ac8ee2ba92149d1abf621f4d2ab15e0cc4997c03","observation_id":"a6aabf19-a49c-4207-bac2-5613d30d567f","resolution":{"observed_at":"2026-08-10T20:18:59.485496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12125","last_updated":"2025-06-15T04:49:56Z","snapshot_observed_at":"2026-08-08T06:11:57.491279Z","submitted_at":"2024-06-17T22:13:22Z","title":"Efficient Sequential Decision Making with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12125","snapshot_observed_at":"2026-08-10T20:18:58.235151Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.235151Z"},"links":{"cited_paper":"/paper/2406.12125","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f905770c36a97a71807974eb0c750f84f191cc9df74d1fafd8d6f04ba2a432fb","observation_id":"347ead80-e5c4-4621-829e-4e98a9ceb1ae","resolution":{"observed_at":"2026-08-10T20:18:58.235151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-10T20:18:58.227604Z","title":"Burda, H","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.227604Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:df05b2997c7a651aaf9c0dc05b79096a91359e4d4f339663e4c2304716ed0c36","observation_id":"cb8c605a-9b60-4b3f-bc7c-8f6cdb4b7128","resolution":{"observed_at":"2026-08-10T20:18:58.227604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.714621Z","title":"Chevalier-Boisvert, B","venue":null,"work_id":"22e93172-adcc-43ca-b883-c85e6a0fcd7d","year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.246134Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:d4063bc132ad591a2f7cc6d87e240f181fbac9ec860f34c5c0d38b0ed10f6182","observation_id":"8aaab6d8-369a-4d56-9696-92deea6f4c9d","resolution":{"observed_at":"2026-08-10T20:18:59.719749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-08T23:50:48.318949Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-10T20:18:58.240737Z","title":"Chevalier-Boisvert, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.240737Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:35462485f93756052beceb260b0371da82969e59006b6943e41d366a6066f6cd","observation_id":"809b04b4-4169-4548-80bd-e8bf0d814cc7","resolution":{"observed_at":"2026-08-10T20:18:58.240737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T20:18:58.255893Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.255893Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:bd7191286d8ec75db2221bfa8354abc57b2e5f8019bf318a88382a77c5ea7f66","observation_id":"0a4710df-e13a-4980-bca6-e52c5ba6cd47","resolution":{"observed_at":"2026-08-10T20:18:58.255893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.697159Z","title":null,"venue":null,"work_id":"1f6f8dbf-ac6b-4940-8c6a-02b05f6fd202","year":2018},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.250970Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:d8c3a6b27d149fea89a6901ae0af15a8cb8f069cdb77b052e9ee1a0c337209cd","observation_id":"486a8b31-40a1-4d5b-ad7c-0c363023fcea","resolution":{"observed_at":"2026-08-10T20:18:59.702888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"cited_work":{"arxiv_id":"2501.08925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.08925","snapshot_observed_at":"2026-08-10T20:18:59.380251Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","venue":"cs.LG","work_id":"f4a91344-88be-43c7-9c45-4a787ea7d238","year":2025},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.266458Z"},"links":{"cited_paper":"/paper/2501.08925","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:3caff73d7005ff4531e9a34082f8ea4ce58f36d0bf713d7aef8c6f963d9448b3","observation_id":"fa4690cf-90ec-4c9a-9a49-e4cb0294a079","resolution":{"observed_at":"2026-08-10T20:18:59.385875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-10T20:18:58.261205Z","title":"Ecoffet, J","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.261205Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:c02b69dce1578921cea0cc3f5cea758a4b21f9ad16afbca7ab0a9abb4953a11f","observation_id":"1b64d18c-6134-4684-b248-88d1f45436a7","resolution":{"observed_at":"2026-08-10T20:18:58.261205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T20:18:58.276424Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.276424Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:d6bf59839f1559473094268b119b79c3a00cc129357d957e432d034ceceb6fc2","observation_id":"80b17858-6ed7-4884-8aa1-45062e23bc9c","resolution":{"observed_at":"2026-08-10T20:18:58.276424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09971","last_updated":"2024-02-01T00:42:31Z","snapshot_observed_at":"2026-08-04T03:14:08.494198Z","submitted_at":"2023-10-15T22:20:39Z","title":"AMAGO: Scalable In-Context Reinforcement Learning for Adaptive Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09971","snapshot_observed_at":"2026-08-10T20:18:58.271222Z","title":"Grigsby, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.271222Z"},"links":{"cited_paper":"/paper/2310.09971","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:616f071fb859426441b0fa67547d3c71c59bff6430cec4e725dfaedef9fc1024","observation_id":"1707be96-f40c-454b-af6a-dc5723a0ef14","resolution":{"observed_at":"2026-08-10T20:18:58.271222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-10T20:18:58.286376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.286376Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:6b761338ab78ae613c9eecc92865394c18d464b555a5e1312e00996e47d056a4","observation_id":"fda2ffc1-b5cb-4199-8ecb-6cc226be7279","resolution":{"observed_at":"2026-08-10T20:18:58.286376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06780","last_updated":"2022-02-12T20:02:13Z","snapshot_observed_at":"2026-08-08T06:33:33.529614Z","submitted_at":"2021-09-14T15:49:31Z","title":"Benchmarking the Spectrum of Agent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06780","snapshot_observed_at":"2026-08-10T20:18:58.281444Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.281444Z"},"links":{"cited_paper":"/paper/2109.06780","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:e4352579b8e19f8e01d7574926831c3dcbfc1c3d3a650a6a04e24906c11c7fd8","observation_id":"3a91a203-1efd-4d38-918f-ef197a4e667c","resolution":{"observed_at":"2026-08-10T20:18:58.281444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07456","last_updated":"2024-04-11T03:31:54Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T03:31:54Z","title":"WESE: Weak Exploration to Strong Exploitation for LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07456","snapshot_observed_at":"2026-08-10T20:18:58.297123Z","title":"Huang, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.297123Z"},"links":{"cited_paper":"/paper/2404.07456","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:b3c2272ca3bc0ba62cbd199d4e8ad2b02ee1deb8b7e90a5013176e36e32d8cb7","observation_id":"0778d96a-f16a-4e59-a6e0-40890b108f29","resolution":{"observed_at":"2026-08-10T20:18:58.297123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-10T20:18:58.291538Z","title":"Huang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.291538Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:1ad32bca11263ec1031a6246f19ab43ea81efc00fc1e4e01d0ee2f636cc7776b","observation_id":"d723556d-ac2a-40f0-a59a-023ca1f118f8","resolution":{"observed_at":"2026-08-10T20:18:58.291538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T20:18:58.309398Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.309398Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:78637cfc6aca3350a3fa7733323a445de683c51497d85541fd71f18bb3d8253d","observation_id":"1f2968bd-a1b4-4896-afcf-b6590903dec3","resolution":{"observed_at":"2026-08-10T20:18:58.309398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05398","last_updated":"2023-03-04T04:43:49Z","snapshot_observed_at":"2026-08-10T10:27:53.912238Z","submitted_at":"2023-03-04T04:43:49Z","title":"MathPrompter: Mathematical Reasoning using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05398","snapshot_observed_at":"2026-08-10T20:18:58.303099Z","title":"Imani, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.303099Z"},"links":{"cited_paper":"/paper/2303.05398","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:cb54815621db6fcf019ecab1505dea8a717dedd205ab8577a1b25074405b908b","observation_id":"189c52e6-20cc-48a8-8141-865ae5157366","resolution":{"observed_at":"2026-08-10T20:18:58.303099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:58.320667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.320667Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:0881761af821ab6c1506ceed6c373e15a7a4f0735f99f77e230b247914ebe686","observation_id":"26910b9d-19f2-4e9f-b9d3-109937cdb717","resolution":{"observed_at":"2026-08-10T20:18:58.320667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01817","last_updated":"2024-06-12T01:13:11Z","snapshot_observed_at":"2026-08-09T23:22:57.992966Z","submitted_at":"2024-02-02T14:43:18Z","title":"LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01817","snapshot_observed_at":"2026-08-10T20:18:58.315070Z","title":"Kambhampati, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.315070Z"},"links":{"cited_paper":"/paper/2402.01817","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:09245124b88c7e4db3231cded78680eeb2100dbbbdf6f5823123feee12b5fddc","observation_id":"9396374a-002a-4bdc-971f-95e14ebec8a8","resolution":{"observed_at":"2026-08-10T20:18:58.315070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-10T20:18:58.331917Z","title":"Krishnamurthy, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.331917Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:73b71d9f601834b75e23f7df6ff2da790052d96f7d452d8ded828f8e917dcfe1","observation_id":"4ab7306b-2fd0-40d9-820a-bbd08cc26b17","resolution":{"observed_at":"2026-08-10T20:18:58.331917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.679588Z","title":null,"venue":null,"work_id":"9431ab8b-3576-4971-9299-028198fa2bd6","year":2005},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.326052Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:4cc1f399c4c24ded4565632afce2f91e1d3e9401d4b18fc1b926d706fd51fc12","observation_id":"956721f7-63ce-4a66-ad9f-ff2cb0d6ce3f","resolution":{"observed_at":"2026-08-10T20:18:59.685078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-08-11T00:48:03.626777Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-10T20:18:58.342404Z","title":"Laskin, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.342404Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:51051e50c6310f654c87289d5e6405fc39affc39bb75b9ef417369a4ad7462da","observation_id":"d8cf034a-8ea2-4753-86a0-2fb3f50e44b9","resolution":{"observed_at":"2026-08-10T20:18:58.342404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.663581Z","title":"Küttler, N","venue":null,"work_id":"1e0776a1-df94-4813-ac85-5c93a116b257","year":2020},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.337487Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:b47799d1863e3471604faeee99eb42c59d3745291a6e36d7670baedb1c63a52f","observation_id":"b8b17ff5-3e43-472c-b878-20add7c71e4f","resolution":{"observed_at":"2026-08-10T20:18:59.668808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-10T20:18:58.352768Z","title":"Lillicrap","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.352768Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:02e9412b01654861ba908bc0a11585ef79f441174b43ca766af7f76c4f505b46","observation_id":"226d3299-5e91-47a9-81cf-b4170ee0e970","resolution":{"observed_at":"2026-08-10T20:18:58.352768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00607","last_updated":"2022-10-31T19:59:33Z","snapshot_observed_at":"2026-08-04T13:54:54.850573Z","submitted_at":"2021-10-31T22:20:36Z","title":"A Systematic Investigation of Commonsense Knowledge in Large Language Models","version":3},"cited_work":{"arxiv_id":"2111.00607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.00607","snapshot_observed_at":"2026-08-10T20:18:59.121601Z","title":"A Systematic Investigation of Commonsense Knowledge in Large Language Models","venue":"cs.CL","work_id":"a0f9ea68-3d90-4c50-bd55-cf34a42b69fe","year":2021},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.347424Z"},"links":{"cited_paper":"/paper/2111.00607","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:fadc5d94128fd19ed32b51c94fab52394787d39baf8a8c2818d972d0d02b54ec","observation_id":"0c56a136-b35b-4cfb-80a5-29a92aa4bfd6","resolution":{"observed_at":"2026-08-10T20:18:59.127093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15143","last_updated":"2025-02-07T11:10:39Z","snapshot_observed_at":"2026-07-06T18:19:04.614208Z","submitted_at":"2024-05-24T01:45:27Z","title":"Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15143","snapshot_observed_at":"2026-08-10T20:18:58.363672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.363672Z"},"links":{"cited_paper":"/paper/2405.15143","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f345d3694987572ece2eba477a695359d4e4884340a527872b7718ea2de32898","observation_id":"65a75fa9-caf1-47ea-8989-419b5f6b589c","resolution":{"observed_at":"2026-08-10T20:18:58.363672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-10T20:18:58.358394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.358394Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:dd908088814d66c48cf85ad40c81021f3858b43383bd2c7068af6af0c33f310e","observation_id":"d19a85b6-b431-4043-956d-92d26a775b71","resolution":{"observed_at":"2026-08-10T20:18:58.358394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00046","last_updated":"2023-03-31T18:03:30Z","snapshot_observed_at":"2026-07-06T15:10:41.528837Z","submitted_at":"2023-03-31T18:03:30Z","title":"Accelerating exploration and representation learning with offline pre-training","version":1},"cited_work":{"arxiv_id":"2304.00046","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.00046","snapshot_observed_at":"2026-08-10T20:18:59.034259Z","title":"Accelerating exploration and representation learning with offline pre-training","venue":"cs.LG","work_id":"42deb4b7-5205-4c3f-bfe0-72c52773311b","year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.373995Z"},"links":{"cited_paper":"/paper/2304.00046","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:ce13700363310de1c26921d97543791294ea9c4dc798dcccf6249fd4d441ecdc","observation_id":"58486615-9a0c-4c02-8d55-6663342b4a54","resolution":{"observed_at":"2026-08-10T20:18:59.039540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08172","last_updated":"2024-02-21T17:42:32Z","snapshot_observed_at":"2026-07-06T16:18:49.258642Z","submitted_at":"2023-09-15T05:44:08Z","title":"LASER: LLM Agent with State-Space Exploration for Web Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08172","snapshot_observed_at":"2026-08-10T20:18:58.368973Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.368973Z"},"links":{"cited_paper":"/paper/2309.08172","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:69814a0d0440be6229be8b5519be63941f68e265bc01ad9cae86cabff418a6c8","observation_id":"95902126-9dc4-42b6-a28b-47794fead0fe","resolution":{"observed_at":"2026-08-10T20:18:58.368973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-10T20:18:58.385039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.385039Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:50eda0698983c14d24b7ebd3397f242abeb10b7eb283bac8df72c5f1d4226815","observation_id":"5055f052-c402-4c9f-b2e6-6520b3950480","resolution":{"observed_at":"2026-08-10T20:18:58.385039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-10T20:18:58.379372Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.379372Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:8713123eecdaf199ef1a291290a8e8a1d3c7b9d4185e245522e5d368faaee7c4","observation_id":"31db0b48-286b-4995-9191-cdc66f0167ae","resolution":{"observed_at":"2026-08-10T20:18:58.379372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.646882Z","title":"OpenAI o1-mini","venue":null,"work_id":"b3800e07-f446-4598-8bd0-74d41e4af3fb","year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.397494Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:73a53499cd497aa0f7b534a36978ab70fc3ad7dd68e75c69f22f08b86edda95a","observation_id":"e8bb7481-8b1d-4b95-ad1c-9b0f54f0edf7","resolution":{"observed_at":"2026-08-10T20:18:59.652265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02276","last_updated":"2024-11-04T23:33:38Z","snapshot_observed_at":"2026-07-30T23:36:30.273084Z","submitted_at":"2023-07-05T13:20:21Z","title":"First-Explore, then Exploit: Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02276","snapshot_observed_at":"2026-08-10T20:18:58.390579Z","title":"Norman and J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.390579Z"},"links":{"cited_paper":"/paper/2307.02276","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:947d302842d9e3325a5bf28ba9b6aad92116b505ccefe91507017f48b6734343","observation_id":"049b0a02-6458-4065-a8e0-0c367025c292","resolution":{"observed_at":"2026-08-10T20:18:58.390579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:58.408716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.408716Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:35c7282b13d0979adc0950993bfbca77a976ece42020e57ded0ac54eaa993b7a","observation_id":"4b7b7de8-3265-4285-bca6-db07e16b2947","resolution":{"observed_at":"2026-08-10T20:18:58.408716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-08-10T17:42:21.198695Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-10T20:18:58.403115Z","title":"Paglieri, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.403115Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f3b15e15811eca101d37331a07727e6777e891b70cd087ab9bc05f73b792e704","observation_id":"e1ded799-6ef0-4fd9-a49d-f408ec13da6a","resolution":{"observed_at":"2026-08-10T20:18:58.403115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07368","last_updated":"2023-12-12T15:36:59Z","snapshot_observed_at":"2026-07-06T17:00:33.386675Z","submitted_at":"2023-12-12T15:36:59Z","title":"Sequential Planning in Large Partially Observable Environments guided by LLMs","version":1},"cited_work":{"arxiv_id":"2312.07368","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.07368","snapshot_observed_at":"2026-08-10T20:18:58.834528Z","title":"Sequential Planning in Large Partially Observable Environments guided by LLMs","venue":"cs.AI","work_id":"5322dcef-5c64-408c-99bb-5a7145c20092","year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.420211Z"},"links":{"cited_paper":"/paper/2312.07368","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:9e5b2d737f9abf9cc1aed18d74a6592e261c8ddbcd4d28a3f41ab034a5172f23","observation_id":"b0e487ac-8e5b-4eed-b7a0-6aecfcbd5b7c","resolution":{"observed_at":"2026-08-10T20:18:58.840397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.629550Z","title":"Pathak, P","venue":null,"work_id":"7ce0c630-bd0e-45d4-8656-fe04f6410b0c","year":2017},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.414108Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:94eb07036257cf35ce1d4c5fc82ad72990c0a80042c112d744c3787e355de21a","observation_id":"64042dd7-7d05-4964-b7d1-31ec9a94ba0c","resolution":{"observed_at":"2026-08-10T20:18:59.634863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01441","last_updated":"2025-05-23T11:13:40Z","snapshot_observed_at":"2026-07-06T20:00:09.775334Z","submitted_at":"2024-12-02T12:31:58Z","title":"LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01441","snapshot_observed_at":"2026-08-10T20:18:58.431750Z","title":"Ruoss, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.431750Z"},"links":{"cited_paper":"/paper/2412.01441","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:014477ff9b67e2ca13656fc496d9f27b88e276a0abcbe6fb892722d50a7eae57","observation_id":"e6abf4a5-82f5-48b3-b248-ead0e00d8691","resolution":{"observed_at":"2026-08-10T20:18:58.431750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06025","last_updated":"2024-10-25T22:26:41Z","snapshot_observed_at":"2026-07-06T17:27:41.385431Z","submitted_at":"2024-02-08T19:57:29Z","title":"Doing Experiments and Revising Rules with Natural Language and Probabilistic Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06025","snapshot_observed_at":"2026-08-10T20:18:58.426352Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.426352Z"},"links":{"cited_paper":"/paper/2402.06025","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f66be57ad06d8206ec35a6f3e42da3fcc9b6498bd9a6823390edcb32ec715426","observation_id":"75696448-fa7a-477f-9490-2dda829c9369","resolution":{"observed_at":"2026-08-10T20:18:58.426352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.612775Z","title":"Schäfer, F","venue":null,"work_id":"265789b8-586c-4679-b53f-2db8e14a1ddd","year":2021},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.441956Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:89cd26d59e4bd0128b5dbb27342521c50f3c1d23bcfe5097dc7f854d9919c128","observation_id":"ff11d04f-a8a3-42ac-a124-2b9c94c822e6","resolution":{"observed_at":"2026-08-10T20:18:59.617844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13202","last_updated":"2021-11-16T21:17:20Z","snapshot_observed_at":"2026-08-11T16:45:20.817453Z","submitted_at":"2021-09-27T17:22:42Z","title":"MiniHack the Planet: A Sandbox for Open-Ended Reinforcement Learning Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13202","snapshot_observed_at":"2026-08-10T20:18:58.436794Z","title":"Samvelyan, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.436794Z"},"links":{"cited_paper":"/paper/2109.13202","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:8ec0464ce22101f48bfc5b3cbed4779fc89f70d5f1f8cfa892abd33f80fc6fa5","observation_id":"a36c3d67-9610-49f4-8e4f-4fd5afe62610","resolution":{"observed_at":"2026-08-10T20:18:58.436794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07071","last_updated":"2025-08-13T15:48:10Z","snapshot_observed_at":"2026-08-06T21:10:35.884042Z","submitted_at":"2024-10-09T17:15:30Z","title":"Retrieval-Augmented Decision Transformer: External Memory for In-context RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07071","snapshot_observed_at":"2026-08-10T20:18:58.451394Z","title":"Schmied, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.451394Z"},"links":{"cited_paper":"/paper/2410.07071","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f1fe06c5e114f82562e078f506e6aaef3a8e35207a826d1e8e6ed330756d74de","observation_id":"5acd3950-caa4-4486-abf0-d07a019efcbc","resolution":{"observed_at":"2026-08-10T20:18:58.451394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.594750Z","title":"Schmidhuber","venue":null,"work_id":"eef7daba-2012-4ae5-ba47-e523ce9206be","year":1990},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.446609Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:aaaafcf03fd408fdf3b74850f63b402d19d9197d672dc6472106ce50206271d7","observation_id":"d04cbe40-5f26-4459-b67c-d23c2cfe1eff","resolution":{"observed_at":"2026-08-10T20:18:59.599640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07706","last_updated":"2024-10-10T08:19:12Z","snapshot_observed_at":"2026-07-06T19:31:00.754487Z","submitted_at":"2024-10-10T08:19:12Z","title":"AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07706","snapshot_observed_at":"2026-08-10T20:18:58.461847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.461847Z"},"links":{"cited_paper":"/paper/2410.07706","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:3101a8777f03590c7b973350d918b5c2a6009c243b856433cd1b45d493e0de18","observation_id":"5e0ba4ff-9fd4-422e-9b81-d32da5d24a80","resolution":{"observed_at":"2026-08-10T20:18:58.461847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.578212Z","title":"Shinn, F","venue":null,"work_id":"1d51d3fd-c3f3-4b04-a972-02ca9ab66023","year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.456530Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:bf398a8e08352d20941c0a71ff79f05afab6677a84caffd4139e0cf47d670369","observation_id":"48f9fbcf-9989-4e78-b061-5d47869b4d0e","resolution":{"observed_at":"2026-08-10T20:18:59.583090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T20:18:58.472360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.472360Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:be1bcc1ad9e0916f4e1290e666d224e9fcc9b88e60be4fb7b0d53a66ab536278","observation_id":"3742c7b5-f72c-4136-8590-d617fffcaaa3","resolution":{"observed_at":"2026-08-10T20:18:58.472360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T20:18:58.467337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.467337Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:065f969a5adc0f952ec0464be9f846f443a3190932b6fd5bb5ede06ce0bf90b0","observation_id":"f5c28aab-d922-42ca-9e83-a7afcee2b9cb","resolution":{"observed_at":"2026-08-10T20:18:58.467337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.547220Z","title":null,"venue":null,"work_id":"cb4145ad-7f23-4f0f-9470-80f7b52df567","year":2024},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.483576Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:a55624676e469c52478a0d12248186e47cfe48b16411b500d0f5c0e17839836b","observation_id":"94190651-513f-46fb-aa18-7561668ba091","resolution":{"observed_at":"2026-08-10T20:18:59.552068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.562807Z","title":"Valmeekam, M","venue":null,"work_id":"d97e2f62-6f4e-4bb7-8347-ee0c8b98e8f4","year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.477916Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:b203a552f84718f662ecabef0cc0a7a5fc9a23e1edf53fc292663feaea1aa232","observation_id":"f3b4ab18-3592-4c6c-ad1d-f3ff7254ec16","resolution":{"observed_at":"2026-08-10T20:18:59.567823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01557","last_updated":"2024-03-17T23:23:31Z","snapshot_observed_at":"2026-08-06T16:46:34.632571Z","submitted_at":"2023-10-02T18:52:11Z","title":"SmartPlay: A Benchmark for LLMs as Intelligent Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01557","snapshot_observed_at":"2026-08-10T20:18:58.494246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.494246Z"},"links":{"cited_paper":"/paper/2310.01557","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:fa445484945e07023933724e01fbbe2f16aa401e93c48f976040d2266a653828","observation_id":"b6e492cf-cafb-4b0a-a162-0297a0209807","resolution":{"observed_at":"2026-08-10T20:18:58.494246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09458","last_updated":"2021-07-01T16:03:55Z","snapshot_observed_at":"2026-08-06T01:52:53.175095Z","submitted_at":"2021-01-23T08:51:04Z","title":"Decoupled Exploration and Exploitation Policies for Sample-Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2101.09458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.09458","snapshot_observed_at":"2026-08-10T20:18:58.690637Z","title":"Decoupled Exploration and Exploitation Policies for Sample-Efficient Reinforcement Learning","venue":"cs.LG","work_id":"2b60e829-1c8e-4a72-8c06-413d97662faf","year":2021},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.488803Z"},"links":{"cited_paper":"/paper/2101.09458","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:16b615b95908e70e405575675eebaf0cfccf5af181febe97aab6310047815a4f","observation_id":"96f40b38-d6bf-4eba-a551-55f232d75e5b","resolution":{"observed_at":"2026-08-10T20:18:58.698860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:18:59.530647Z","title":null,"venue":null,"work_id":"9fd2e3d3-0495-4e44-ae78-de8aa2738fae","year":2022},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.508986Z"},"links":{"citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:37807bc985f7000276adc43fcc4db846b048217ec70c7cc768e0cad2f6a983bc","observation_id":"37cc3db9-8ca4-425b-a299-271f004f579c","resolution":{"observed_at":"2026-08-10T20:18:59.536075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09841","last_updated":"2024-09-15T07:49:32Z","snapshot_observed_at":"2026-07-06T15:43:27.458645Z","submitted_at":"2023-06-16T13:39:35Z","title":"Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09841","snapshot_observed_at":"2026-08-10T20:18:58.500173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.500173Z"},"links":{"cited_paper":"/paper/2306.09841","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:f3797bf91ae71163d17d57e53d2b20f91a66383d78084b8889f1be3b69161ac5","observation_id":"e68580c5-533a-4706-954a-bbd6c8dcf546","resolution":{"observed_at":"2026-08-10T20:18:58.500173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-10T20:18:58.519583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.519583Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:7a597ed3aa9fb7321e64f54ed68665952f00e1e1ef8a710dbeeb9e4499d87428","observation_id":"fc104b07-5fd9-468e-a9ac-1e7c96accf81","resolution":{"observed_at":"2026-08-10T20:18:58.519583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-10T20:18:58.513808Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.513808Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:d89b3a252af0d8bdd95a5a3f4093ccc2dcaa3babc00b9b73d39b3ccf321fcb64","observation_id":"df5710bb-4147-4536-ad86-55341e7c88d9","resolution":{"observed_at":"2026-08-10T20:18:58.513808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-10T20:18:58.530774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.530774Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:9843ea3a1f8d2cb68e0b1935db76910e058d606710c2a53728f6a94de5a9acc3","observation_id":"c5dbbabd-c9be-4b86-b56c-801f111b2655","resolution":{"observed_at":"2026-08-10T20:18:58.530774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-07T22:31:11.195198Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-10T20:18:58.525337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:18:58.525337Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2501.08925"},"observation_digest":"sha256:6628119b25da47cc129d514f2c0a3fa11b33b75b65302b141ebf43a65ba30943","observation_id":"8923fd79-695d-4e7a-8674-71bac52aaf57","resolution":{"observed_at":"2026-08-10T20:18:58.525337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.08925","last_updated":"2025-08-24T16:04:08Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T00:45:46.949013Z","submitted_at":"2025-01-15T16:30:29Z","title":"Disentangling Exploration of Large Language Models by Optimal Exploitation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":48,"verified_exact":6,"verified_fuzzy":9},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2501.08925."}