{"as_of":"2026-08-10T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2710eac6c4c1566fba4677f5e49f1b6942d60cf61b38040d3dd718e99fcbb15d","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:17:16.825411Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:52:47.188471Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T13:44:40.651347Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-07T05:52:47.188471Z","title":"A survey of in-context reinforcement learning.arXiv preprint arXiv:2502.07978,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-08T05:12:56.302606Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.188471Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:1f86781e3cc454c4e287308e31241e94be07714db8aeebdbe6085257ce6b11ae","observation_id":"1746c1c3-08e4-4fab-af78-76e71a11315e","resolution":{"observed_at":"2026-08-07T05:52:47.188471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-06T15:28:45.819093Z","title":"Moeini, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15815","last_updated":"2025-07-21T17:21:14Z","snapshot_observed_at":"2026-08-07T09:07:30.265550Z","submitted_at":"2025-07-21T17:21:14Z","title":"LLM Economist: Large Population Models and Mechanism Design in Multi-Agent Generative Simulacra","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:45.819093Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2507.15815"},"observation_digest":"sha256:0cf554706960dcb5c2ead88b977ae20968694bf7ba6e78cae6b2625cca8a254a","observation_id":"981418f6-b0d5-49b8-8672-c37bdd9ff3ec","resolution":{"observed_at":"2026-08-06T15:28:45.819093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:064d3da2f5778b004772d4f5eeecfd0816cba091c5a7ce1a266f8a8eaf82d863","observation_id":"d519dff5-6433-4b44-819f-3357bb3c41ec","resolution":{"observed_at":"2026-05-14T22:23:15.883101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-05T22:39:48.540944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06659","last_updated":"2026-06-07T16:02:19Z","snapshot_observed_at":"2026-08-08T21:44:59.279970Z","submitted_at":"2025-08-08T19:23:23Z","title":"In-Context Reinforcement Learning via Communicative World Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T22:39:48.540944Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2508.06659"},"observation_digest":"sha256:fb4ac1b6c146bd0493d13d25f441370675a918e75c0a2dcb070e9596108f74dd","observation_id":"6de6714d-47c2-47d4-8036-ac7410f5e057","resolution":{"observed_at":"2026-08-05T22:39:48.540944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2509.14274","last_updated":"2026-06-29T08:48:10Z","snapshot_observed_at":"2026-08-04T16:40:58.811345Z","submitted_at":"2025-09-16T06:48:11Z","title":"Discovering New Theorems via LLMs with In-Context Proof Learning in Lean","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T16:09:39.975762Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2509.14274"},"observation_digest":"sha256:cc93f0c4b73bb67433a262ff4e1fd0197eb6b41ceb205508a35336d517458bd7","observation_id":"c61b9786-540f-4b8a-b864-1cc67f788d85","resolution":{"observed_at":"2026-05-18T16:11:35.898118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-04T16:41:00.086178Z","title":"A survey of in-context reinforcement learning.arXiv preprint arXiv:2502.07978, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14274","last_updated":"2026-06-29T08:48:10Z","snapshot_observed_at":"2026-08-04T16:40:58.811345Z","submitted_at":"2025-09-16T06:48:11Z","title":"Discovering New Theorems via LLMs with In-Context Proof Learning in Lean","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:41:00.086178Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2509.14274"},"observation_digest":"sha256:91dbdcb0aca1c63dddbf63b6fe5920481bf9574db83052dbe3483043457fb6e0","observation_id":"2b23d148-4e36-4552-818e-6c57ecbdc7db","resolution":{"observed_at":"2026-08-04T16:41:00.086178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-04T13:15:26.025046Z","title":"A survey of in-context reinforcement learning.arXiv preprint arXiv:2502.07978,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01163","last_updated":"2026-06-24T11:54:33Z","snapshot_observed_at":"2026-08-10T04:34:00.898338Z","submitted_at":"2025-10-01T17:52:29Z","title":"How Does the Pretraining Distribution Shape In-Context Learning? A Fundamental Trade-Off","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:26.025046Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2510.01163"},"observation_digest":"sha256:69855b2515e6aa05028c59a3bbed0f93b5cd999f6b320d9394fcdcb7d3aec177","observation_id":"35e8ed47-e3c7-408c-8410-1b327db3676d","resolution":{"observed_at":"2026-08-04T13:15:26.025046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2604.05429","last_updated":"2026-04-08T01:03:11Z","snapshot_observed_at":"2026-07-06T22:54:08.897942Z","submitted_at":"2026-04-07T04:52:51Z","title":"Bridging Natural Language and Microgrid Dynamics: A Context-Aware Simulator and Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:35:57.142293Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2604.05429"},"observation_digest":"sha256:a7195de3cfd0746674ba6df7ae75f078426185c8771cb9520d286548ba9f2507","observation_id":"b97a3c38-4cf1-4a41-b230-4b7b78dd812b","resolution":{"observed_at":"2026-05-10T22:45:49.834480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2604.05859","last_updated":"2026-04-07T13:20:06Z","snapshot_observed_at":"2026-08-03T16:43:40.161272Z","submitted_at":"2026-04-07T13:20:06Z","title":"When Do We Need LLMs? A Diagnostic for Language-Driven Bandits","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T18:32:12.396568Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2604.05859"},"observation_digest":"sha256:e1dab6d6ca7dfd2831b2f58192b2339f23f2d1196bcbd3d67b37daf6e522486b","observation_id":"deed3684-0eec-4925-a1b1-8b3f95ece377","resolution":{"observed_at":"2026-05-11T00:25:51.227419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2605.09727","last_updated":"2026-05-10T19:52:29Z","snapshot_observed_at":"2026-07-31T17:23:23.893636Z","submitted_at":"2026-05-10T19:52:29Z","title":"One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:46:21.786972Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2605.09727"},"observation_digest":"sha256:02f6919335b3cf22dcd64d3d0c76dfb4746fbd692b8e1c1e2ef2e497a3d727a3","observation_id":"31992104-4253-486b-842e-a7b024dd0b6d","resolution":{"observed_at":"2026-05-12T06:56:32.009372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2605.17431","last_updated":"2026-05-17T12:52:54Z","snapshot_observed_at":"2026-08-02T21:12:25.330995Z","submitted_at":"2026-05-17T12:52:54Z","title":"MATE: Solving Contextual Markov Decision Processes with Memory of Accumulated Transition Embeddings","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T13:40:19.541614Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2605.17431"},"observation_digest":"sha256:bcd943793e0a70c917481e318da1a7bb16508cd547dadad61ee1036e633ad9ce","observation_id":"7a82df82-f228-4b6c-bd3a-7d0df59583ca","resolution":{"observed_at":"2026-05-20T13:43:19.568432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.07978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-06-30T13:44:40.651347Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":"24545a57-6974-4e7f-9d8e-949eb859bee3","year":2025},"citing_paper":{"arxiv_id":"2605.24423","last_updated":"2026-05-23T06:39:21Z","snapshot_observed_at":"2026-08-08T00:56:47.482154Z","submitted_at":"2026-05-23T06:39:21Z","title":"Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:41:33.048760Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2605.24423"},"observation_digest":"sha256:b0835fbab1deb4686a06c15be98091ff6cd75d7f1b9ac07e04c4c1668da355ee","observation_id":"9d35b37b-59e1-43eb-9bb7-aa9eedff9f76","resolution":{"observed_at":"2026-06-30T13:44:40.652995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-07-12T13:53:50.979339Z","title":"A Survey of In-Context Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16149","last_updated":"2026-07-09T08:06:50Z","snapshot_observed_at":"2026-08-08T20:09:27.886404Z","submitted_at":"2026-06-15T03:10:17Z","title":"LiteOdyssey: A Lightweight Reasoning AI Agent for Interpretable Rare-Disease Diagnosis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T13:53:50.979339Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2606.16149"},"observation_digest":"sha256:77ae343df48e7eb3e9ba7e914cc94f719ac9ec81ed65d4fc8afccfd8cc64217d","observation_id":"b81742fe-e83e-4f47-9e00-b5a7fc03714a","resolution":{"observed_at":"2026-07-12T13:53:50.979339Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-06T00:32:43.025125Z","title":"arXiv preprint arXiv:2502.07978 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-10T01:19:20.004392Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:43.025125Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:ca3e3369aed7f3ab80fa48328197b080f45d6fbd6d2cd546a75b07b0491807e0","observation_id":"7074d225-71c3-4598-a3c1-0f7418f83691","resolution":{"observed_at":"2026-08-06T00:32:43.025125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07978/citation-record","integrity":"/paper/2502.07978/integrity","json":"/paper/2502.07978/citation-record.json","paper":"/paper/2502.07978"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.605461Z","title":null,"venue":null,"work_id":"cb6e40d9-05ee-4354-85a3-7fb769e421fe","year":2005},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.582744Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:94be155167fe7546520ca9b0238227aa744ac1c0dd02e2b4f07161c66fcd4ee4","observation_id":"c5142e2b-79b4-4023-835a-04a2f51217fd","resolution":{"observed_at":"2026-08-08T11:17:17.608599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.594741Z","title":"In- Context Language Learning : Architectures and Algorithms","venue":null,"work_id":"36b18de3-636d-4f62-bba1-02446c088ef1","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.586650Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:0073d229564baa18c3117a844c168050a8493cd14ced822797fde825a01de182","observation_id":"156d4b8b-1571-40dd-97cf-3f46d689df32","resolution":{"observed_at":"2026-08-08T11:17:17.598129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.584763Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"88a35d56-508b-4a1b-a4bd-e88500656b46","year":2017},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.589773Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:f36391d4495337315f9f016e0cd683f4c2dc652e32f274bcae5c8d08cdb719f1","observation_id":"799bf4c8-e3c5-4242-b7c4-0dd23a3b8e02","resolution":{"observed_at":"2026-08-08T11:17:17.588089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.574023Z","title":"Provable self-play algorithms for competitive reinforcement learning","venue":null,"work_id":"e292223a-cc0a-44a2-96e2-74e3f7ff90bf","year":2020},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.593242Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:cdfbe74b3b033d6aa034edaea6802ada2939eb952a292561da1c738f5bc10690","observation_id":"2e310bd5-15f1-4967-9000-4bb11b482cc2","resolution":{"observed_at":"2026-08-08T11:17:17.577408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.564275Z","title":null,"venue":null,"work_id":"c399b82a-532b-44dc-8eac-db13595321cf","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.596014Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:b406f49861f695428b97758d766c08c703b20b6d22dfde5328fa6871881fa4de","observation_id":"d9e53b31-2c45-4294-83a2-4b26e5035c4e","resolution":{"observed_at":"2026-08-08T11:17:17.567437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.553433Z","title":"A Survey of Meta-Reinforcement Learning","venue":null,"work_id":"8d4e0391-c92c-4b0a-87a7-077206518c7c","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.598876Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:9b69f967962600e04e7b57735113fe35126f33d596efb48edbe0c088ce10ba65","observation_id":"03e198c8-6fb2-4d68-a910-2bdc8b0bff22","resolution":{"observed_at":"2026-08-08T11:17:17.557401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.544672Z","title":"o ppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, G \\","venue":null,"work_id":"f89600e2-10b8-4240-9d83-f002c2c02874","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.602466Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:5ad113a2a0e544ebda4a609e3e2cea5cc99722096318c312a13d5e5471fc71b3","observation_id":"c1b9a8b9-08cf-4526-976c-15467d361668","resolution":{"observed_at":"2026-08-08T11:17:17.547479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.535669Z","title":"When does return-conditioned supervised learning work for offline reinforcement learning? In Advances in Neural Information Processing Systems , 2022","venue":null,"work_id":"14b6af66-c678-463b-9e70-06afa7dc76e4","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.606335Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:83787bcc5833fbd0e360dd7ccaee5fa5929f3a79227033bd27071fd14927ffd5","observation_id":"cb6f6179-b361-4a24-aca9-f6f244d6064c","resolution":{"observed_at":"2026-08-08T11:17:17.538507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-08T11:17:16.609545Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.609545Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:df48116489b3fcc812f8430163d903ef91787083403d6584bba2feae18a2c0a7","observation_id":"3805d8f6-5833-4cb5-a6c9-7073e8d28922","resolution":{"observed_at":"2026-08-08T11:17:16.609545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03431","last_updated":"2021-11-05T12:01:28Z","snapshot_observed_at":"2026-07-06T12:05:49.324375Z","submitted_at":"2021-11-05T12:01:28Z","title":"Learning to Cooperate with Unseen Agent via Meta-Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2111.03431","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.03431","snapshot_observed_at":"2026-08-08T11:17:16.849992Z","title":"Learning to Cooperate with Unseen Agent via Meta-Reinforcement Learning","venue":"cs.AI","work_id":"0cd6c14f-6652-4c65-9b1f-b1a7f737fde1","year":2021},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.615009Z"},"links":{"cited_paper":"/paper/2111.03431","citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:d314b66b7113d0d596738f9b495191a235dc655580b6bf1ac1af85679657554a","observation_id":"f15eb66e-cd5c-4f10-afe8-9f622dedc18d","resolution":{"observed_at":"2026-08-08T11:17:16.855399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.526697Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"8125bf87-427a-4244-9f66-4dff6963467a","year":2021},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.619692Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:56d660799e2c3e67af1fe57396e47588d3c2437caf65dab75fceac6a40432ca2","observation_id":"0db95420-7735-4e59-a0b9-05e828335e27","resolution":{"observed_at":"2026-08-08T11:17:17.529671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.517455Z","title":"Contextual bandits with linear payoff functions","venue":null,"work_id":"b2ab4051-8072-46cf-9674-cc93e64964be","year":2011},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.623037Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:637039cb6000aa25fa20f1262d275a7abe9068c0e6dee35ac33b407e2f0c74ab","observation_id":"1cbe1c46-8225-420c-ad68-d665a0b170b0","resolution":{"observed_at":"2026-08-08T11:17:17.520891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.507129Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"8aec19e4-2617-4f3a-8614-2bfb4fba191c","year":2020},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.626980Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:2383b50be6007ad6510f135b366df145dda42e949ff83084a4f140b574c1bd67","observation_id":"d187e1c2-61b5-4c60-b65a-6554c4e286b7","resolution":{"observed_at":"2026-08-08T11:17:17.510282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.497704Z","title":"Leibo, and Jakob Nicolaus Foerster","venue":null,"work_id":"cc0e959f-5f9d-4123-99ca-99617c4b02e6","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.630776Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:e2538f24a55bcf71e14ac7fc1e02ffcac9eb4f75d690e4b288d7a109fc16f1ee","observation_id":"30da6640-49e4-4136-beae-e4035620846f","resolution":{"observed_at":"2026-08-08T11:17:17.501022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.487759Z","title":"In-context Exploration-Exploitation for Reinforcement Learning","venue":null,"work_id":"73b899ed-7aef-4cec-b43e-a5db90f3252f","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.634649Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:20c7a14abf6878e8578790c07221ba4799ff1e2dd64dac434ad58ca43e3fbfbb","observation_id":"9a0788b5-0b3c-4ee5-a2e2-89bb2bbdac68","resolution":{"observed_at":"2026-08-08T11:17:17.491430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.477690Z","title":"A Survey on In-context Learning","venue":null,"work_id":"711835ca-dc96-42f5-856f-04d84f440a3d","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.638723Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:26c3358d0130b191bfc3207567527f391dfef423608156a15176eb1dca0a65d5","observation_id":"f7aa4d54-b25f-470d-9158-cddeb14186d8","resolution":{"observed_at":"2026-08-08T11:17:17.480905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.468393Z","title":"Fang, Zhuoran Yang, and Vahid Tarokh","venue":null,"work_id":"20f90285-2a12-44d0-bf77-f8b237afe0a5","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.642896Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:7f16bd9a51b5bfdcf421fe14ee88ecd9f9241dfd7b1db91e79412df14463d30f","observation_id":"3390d03f-44d1-4113-a98e-6dd500d0d328","resolution":{"observed_at":"2026-08-08T11:17:17.471641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.458050Z","title":"Bartlett, Ilya Sutskever, and Pieter Abbeel","venue":null,"work_id":"8bf8d20c-edea-4bdb-a86f-76b707b286d8","year":2016},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.647211Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:3001ca1454ab8ae02748da782757f44cb1b812eec50b4e6710761b4f2147c174","observation_id":"229b1152-d29f-44f1-80b2-b77206c00638","resolution":{"observed_at":"2026-08-08T11:17:17.461704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.446897Z","title":"ReLIC : A Recipe for 64k Steps of In-Context Reinforcement Learning for Embodied AI","venue":null,"work_id":"3edec050-e4b4-419c-9fea-2a7795638b1a","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.651122Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:8a10ca961c7dee6d16e26d6bcb98ff4c0cdca11f276189217f715f9b708213f4","observation_id":"1dfd90c9-a79e-411f-9e1a-586778f4dd26","resolution":{"observed_at":"2026-08-08T11:17:17.450960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.435851Z","title":"Rvs: What is essential for offline RL via supervised learning? In Proceedings of the International Conference on Learning Representations , 2022","venue":null,"work_id":"92ce2ef9-8117-4108-b3cf-fa25f6b50399","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.655750Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:cb9b330f967320af5c8505aee2df314ce4a27d692c12e0b5239283e73df88968","observation_id":"3362b539-4485-4c12-a88b-d3e5046b1432","resolution":{"observed_at":"2026-08-08T11:17:17.440145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.424897Z","title":"Generalized decision transformer for offline hindsight information matching","venue":null,"work_id":"0e96d8a9-afe4-4a92-8aaa-49a935b5a0d8","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.659120Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:aa27faafc49752958d91171b717a8f2b0b2d4f71b45ba845f838568db9d0253a","observation_id":"818dc4f3-8438-478f-8349-4d4e360166ea","resolution":{"observed_at":"2026-08-08T11:17:17.429363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.416368Z","title":"Meta-rl for multi-agent rl: Learning to adapt to evolving agents","venue":null,"work_id":"f2e9972e-ac85-4135-b06e-fbee6edf8528","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.662842Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:7bb1d843d6db73906f86a69b8222817670188dab62af3f613ea053a151ebfbee","observation_id":"0e0ff42a-1014-402f-b26e-4fd4d17a99fa","resolution":{"observed_at":"2026-08-08T11:17:17.419316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.406119Z","title":"AMAGO : Scalable In-Context Reinforcement Learning for Adaptive Agents","venue":null,"work_id":"fe0e3c59-9970-4dbc-a7d7-bf46bdb7da18","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.667117Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:dc67744fb60766d65ded278f8954b12b0814a8c04fe7233ad99bf3c3d4a7c8d0","observation_id":"59227d69-e035-421a-9cb4-0240c35415b5","resolution":{"observed_at":"2026-08-08T11:17:17.408938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.396862Z","title":"AMAGO-2 : Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","venue":null,"work_id":"9c0b8d1a-1b7e-406d-b9b0-805e264e7256","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.670757Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:1d46396f69f17ced9a689e1901f32c8a7e4c322a150b7a35303ba7d72b851a13","observation_id":"296fcb9c-ade6-4fe9-830b-6a3743b85c22","resolution":{"observed_at":"2026-08-08T11:17:17.399788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.387408Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":null,"work_id":"62af2799-68af-4b49-8e60-e01a37af0fc3","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.674363Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:0f35213e1582f5d926de13a2328e9278f93a6b9806f0c6afab5f9a46de9474f3","observation_id":"3b40f51c-d553-4d8f-843f-703ce0f32da5","resolution":{"observed_at":"2026-08-08T11:17:17.390380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.377850Z","title":"Muesli: Combining improvements in policy optimization","venue":null,"work_id":"75502af5-c4d0-442d-a34d-b72a0bf5afe7","year":2021},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.677706Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:238c1d16c1a66b67d3a65ae7bdfb7808b89bb5277e94e64d97d0eb4faa932221","observation_id":"8a9be31d-5da3-4e15-93b3-18e3be91ee68","resolution":{"observed_at":"2026-08-08T11:17:17.381078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.368696Z","title":"In- Context Decision Transformer : Reinforcement Learning via Hierarchical Chain-of-Thought","venue":null,"work_id":"59da8513-d7e3-48e4-bf6f-0073cc1befbb","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.680398Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:732717b469567fd30381befa8f0e302ee00d2a677ced886477b895ca9e38344f","observation_id":"74cedd12-82e6-4c2f-a1fd-88accccdba19","resolution":{"observed_at":"2026-08-08T11:17:17.371898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.358154Z","title":"Decision Mamba : Reinforcement Learning via Hybrid Selective Sequence Modeling","venue":null,"work_id":"3f5ab868-8833-4a0a-afb5-2017a27ee1fd","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.683046Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:a644d3d41d606f5a4e41cf1907cd5552855f900c840a10f9837c52a47150d8ae","observation_id":"029964cc-6c59-48b2-8703-99d1423ef9f6","resolution":{"observed_at":"2026-08-08T11:17:17.362073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.347537Z","title":"V-learning—a simple, efficient, decentralized algorithm for multiagent reinforcement learning","venue":null,"work_id":"3c7bd4ba-d20a-4e1a-80f1-d0e0a7e042ef","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.685609Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:c51bcddbb8fc107cd2647f11af8fb03259c5ebae7f36da906764fa015055f1cf","observation_id":"31b4c2a6-a1f0-433b-b38b-99357e9a7a5e","resolution":{"observed_at":"2026-08-08T11:17:17.350883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.336664Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"54a28e71-80f2-4dab-882a-6bf63e2beeff","year":2017},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.688085Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:e4e4a32e2052b1a943c80d048b573319b79885c375d898b0a3ac02928b599778","observation_id":"8cbbe734-8232-489a-a856-c9f1b301a60d","resolution":{"observed_at":"2026-08-08T11:17:17.339791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.326791Z","title":"A Survey of Zero-shot Generalisation in Deep Reinforcement Learning","venue":null,"work_id":"d1c84690-4ba2-44b1-919a-b8e9339ebaf3","year":2021},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.690670Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:44fdd01334ecf6dddbab9b7a66a1cff3047976b216bb8fd45f133a45ba7c8ec5","observation_id":"f9528815-93e5-4853-9ea4-cc79fee72be4","resolution":{"observed_at":"2026-08-08T11:17:17.330386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.316255Z","title":"Daniel Freeman, Jascha Sohl-Dickstein , and J \\\"u rgen Schmidhuber","venue":null,"work_id":"1496a19e-2130-4aea-a704-f5e319a8fb66","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.693165Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:a9bb656e4f7b523e0840153fd4efd6b209934b11fb1d8d0e429aa3af1745667f","observation_id":"3f9400ac-8e29-4650-a793-ce5c449addfb","resolution":{"observed_at":"2026-08-08T11:17:17.319455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.305631Z","title":"Foster, Cyril Zhang, and Aleksandrs Slivkins","venue":null,"work_id":"d209144b-e40d-4294-8c90-781a843e7b8b","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.696034Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:04b484c8aea78089f5f5bec2b88aa95401759913755a264ed865294fd93f1959","observation_id":"4b8fee5b-b0fb-4e4e-9ad3-c385c518b69c","resolution":{"observed_at":"2026-08-08T11:17:17.308851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.294929Z","title":"Brooks, Maxime Gazeau, Himanshu Sahni, Satinder Singh, and Volodymyr Mnih","venue":null,"work_id":"e07c7462-01a4-4b33-a73b-3f8e7b43cf5d","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.698567Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:b7c6ee050cc223fec232dec2761ca5ef22ff0fd8de81282d16e8783bb135bb1a","observation_id":"31167b1f-b57d-4920-8f47-6d85d28b2cc3","resolution":{"observed_at":"2026-08-08T11:17:17.298193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.285033Z","title":"Supervised pretraining can learn in-context reinforcement learning","venue":null,"work_id":"c5b9684c-8ed9-4bc6-9e9e-b7d8f3956c44","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.701150Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:ad04cc99076577a49831182fa539bee2d1f658d516ec84df138b1aee91db56de","observation_id":"feca94a5-1738-4888-8dd1-aa806819c85a","resolution":{"observed_at":"2026-08-08T11:17:17.287849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.275572Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"11b6c149-3a38-4203-b142-d06f146538b6","year":2019},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.704863Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:cb55ef9ee8f685d3cc9de767e942b7ca7ca063bab5657af64092a94fee5a2000","observation_id":"d4ba52b1-8f3e-43cf-be8e-3d2a83d33354","resolution":{"observed_at":"2026-08-08T11:17:17.278283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.266673Z","title":"Transformers as Decision Makers : Provable In-Context Reinforcement Learning via Supervised Pretraining","venue":null,"work_id":"936fef6f-b24f-41bc-b542-cb4aba3653e6","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.707316Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:77cb8eed57537b8840c3b931475a723b310084a42c8d936dc13af87086cb4fe3","observation_id":"b06f1201-dcba-45c8-9488-df751d906ab0","resolution":{"observed_at":"2026-08-08T11:17:17.269470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.256890Z","title":"Emergent agentic transformer from chain of hindsight experience","venue":null,"work_id":"512f5013-bc49-4ee9-a53b-da6200dfb780","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.709906Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:a4e9e4bd536d6435212f7a40c95c20dc75223275002e1b8ecc21395ae5eb1fbc","observation_id":"93520946-1586-4a17-888d-5d13126c56a9","resolution":{"observed_at":"2026-08-08T11:17:17.259666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.247561Z","title":"Goal-conditioned reinforcement learning: Problems and solutions","venue":null,"work_id":"f3057549-6bf6-4c63-b4b9-3db51ccf29cc","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.712913Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:91176ad6e8588a9d7eb92431a885cb82b022cfdf7cb26ff67d5c0430897b4c79","observation_id":"18d587dc-5e56-412f-a3d6-715ff8f8c9a7","resolution":{"observed_at":"2026-08-08T11:17:17.250369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.237730Z","title":"Foerster, Satinder Singh, and Feryal M","venue":null,"work_id":"e4549fb3-ec8b-46bc-8faf-b271dfd85340","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.716408Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:d6ca4cca9f8aafc7bb2028427b9b6d6ec68be6a0aa649eba019a02e231c8ca71","observation_id":"78e7fbde-bb21-4cb1-b0b9-7567d6ee983b","resolution":{"observed_at":"2026-08-08T11:17:17.240733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.228356Z","title":null,"venue":null,"work_id":"523d31fd-3ca7-4fd5-ad33-fca60e04798e","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.718958Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:3cc6a8b854fdcfa76131e9fd61e98c6e90c72c5af8cddd9117c583e7f5fb5b5d","observation_id":"a9a13e95-e135-49f6-bcd2-b81221697025","resolution":{"observed_at":"2026-08-08T11:17:17.231286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.218441Z","title":"Offline pre-trained multi-agent decision transformer","venue":null,"work_id":"b8288bfe-b6a3-4ca4-807d-7bb2f9ae31da","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.721675Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:b3eb64fffe6fc90e2e74beeb8239f548dd098cc732b4e2ba2726ee4d464d8e1b","observation_id":"f8ab1639-37e8-4c6f-a68b-5031b7938460","resolution":{"observed_at":"2026-08-08T11:17:17.221828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.208345Z","title":"A simple neural attentive meta-learner","venue":null,"work_id":"c85c8877-1fa5-42be-a82a-4039827e6586","year":2018},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.724595Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:252210ee7c8b4114ff858cf519752faf47e8dee9a8b7c37524334a0d35c4e92c","observation_id":"1c5ae4ba-8210-4c11-a67c-80a5194594b2","resolution":{"observed_at":"2026-08-08T11:17:17.212032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.197617Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"c538ea25-ada4-470d-b64e-93cb147ac668","year":2015},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.727671Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:bd6129cad457c4723a22ad4ec122ce37c0255ec56b9e123516b76d51b003a00a","observation_id":"842631a6-c72c-4a2e-9085-2aaa58fed02c","resolution":{"observed_at":"2026-08-08T11:17:17.201207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.187444Z","title":"First- Explore , then Exploit : Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs","venue":null,"work_id":"9467e920-eed8-4ec3-959d-2e71db7e1fe7","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.730174Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:8fa3f9ce970928cb486d1a1f2cd5b47e0cde426b0cacb8f5a5f2289a6f36f3e9","observation_id":"6e5072ed-4b60-4e8a-838d-21b06a543f30","resolution":{"observed_at":"2026-08-08T11:17:17.191020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.177150Z","title":"Do LLM Agents Have Regret ? A Case Study in Online Learning and Games","venue":null,"work_id":"cd413d34-5fcc-4eda-b537-f312df64e095","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.733241Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:888656b47be89a8f247da402cf1b60af62a3ee84ea4f8e0964c35f3a28a00ee8","observation_id":"f37dda9c-f985-4f68-ad9d-2940a7640f1d","resolution":{"observed_at":"2026-08-08T11:17:17.180707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.166663Z","title":"Efficient off-policy meta-reinforcement learning via probabilistic context variables","venue":null,"work_id":"502a001b-0f56-464e-b1b8-b9b6d7ff94b0","year":2019},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.736892Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:8b49d58c5ae70d332ff31347d124c53f9bf41a66208f6360ab839d758c1aea7e","observation_id":"e25b7145-2082-4cef-b396-baddc3af9ecb","resolution":{"observed_at":"2026-08-08T11:17:17.169543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.156965Z","title":"Generalization to New Sequential Decision Making Tasks with In-Context Learning","venue":null,"work_id":"8fe623e6-04e5-45ba-b5d2-d14bf2e97c59","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.740536Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:d060f47c846d0b34815c23631c436ef50426b174bdbd76b7d1d3401dacda4abc","observation_id":"060223cc-bdbd-4bc5-9e8e-6455752ee667","resolution":{"observed_at":"2026-08-08T11:17:17.159843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.146522Z","title":"Wang, Zeb Kurth - Nelson, Siddhant M","venue":null,"work_id":"1fe2552c-d0da-4d4b-949f-e1027f79bccc","year":2018},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.743854Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:aa1dbd212fe823a90ff7830f48c0be31c790fe4f5b027dbec78895e7b38c910e","observation_id":"7ffc8df1-8f57-44da-a1bf-dae1aed80783","resolution":{"observed_at":"2026-08-08T11:17:17.149786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.136747Z","title":"A tutorial on thompson sampling","venue":null,"work_id":"69c177b8-c320-43ab-8413-8d4355b2cf2f","year":2018},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.747584Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:b590a821d3322a30ebbb9d396a527cc08ef4e33731684e7bf1ef2a153059c6d0","observation_id":"e4234989-ec69-46d4-b00d-b9659e3dcc9f","resolution":{"observed_at":"2026-08-08T11:17:17.139470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.127926Z","title":"o ppel, Johannes Brandstetter, G \\","venue":null,"work_id":"f72b6dde-aad3-49d9-867e-88412021649a","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.750608Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:c86f66bb82b3365020fd9136b2bc4fd5bf7bac3bf3f78873f398ccea2061db1b","observation_id":"a3985274-a346-4458-b189-339491a18d86","resolution":{"observed_at":"2026-08-08T11:17:17.130760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.118704Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":"0fc01882-6f81-4b7f-817b-d232c0a387e7","year":2017},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.754602Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:b2efcd74e72cb5b8b19bed1f052628d43ba987a00e8a907f811f7a43772c4e0a","observation_id":"52d16628-b98b-46d3-9213-cc8d6a66baca","resolution":{"observed_at":"2026-08-08T11:17:17.122114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.107580Z","title":"A primal-dual perspective of online learning algorithms","venue":null,"work_id":"745b8997-329f-4a55-9fd3-43d47c129a23","year":2007},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.758103Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:7a868ea8ac7e53cd14a13e0b2ac1c172fac68701d8eb61cf6370710f814763a3","observation_id":"d99a9082-00de-4b49-b11f-bc53519165df","resolution":{"observed_at":"2026-08-08T11:17:17.111531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.097690Z","title":"Cross-episodic curriculum for transformer agents","venue":null,"work_id":"5d31e4e4-4c04-4471-b25a-f2fdad58e30f","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.761240Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:e9ac206d7ceddaaf6d5fc11c2fa0074c7f8aaaecd438ec3cf895ddf6300de4da","observation_id":"c1063b9e-4bde-4ae6-82f8-a06108fd5dd8","resolution":{"observed_at":"2026-08-08T11:17:17.101169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.086504Z","title":"Transformers as Game Players : Provable In-context Game-playing Capabilities of Pre-trained Models","venue":null,"work_id":"5457814f-2535-4410-b989-f52b3ace73cf","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.764507Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:dbf9138a769697cb563595f85d3c2c75ac5d407a66b1684b42e56c64401671cb","observation_id":"235deb61-b564-464a-aafa-16bdcb1e25e8","resolution":{"observed_at":"2026-08-08T11:17:17.089859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.075359Z","title":"In- Context Reinforcement Learning for Variable Action Spaces","venue":null,"work_id":"f0bf75bc-1ef1-4059-a9f6-6c1894a035ca","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.767770Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:7a3c0a35a7ef8849bcf5f6935cd39cfe7d0906bf4f401c40d451cb8170fae736","observation_id":"95a5558b-d3e7-4744-be73-6156a36606ca","resolution":{"observed_at":"2026-08-08T11:17:17.078794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.064652Z","title":null,"venue":null,"work_id":"bb8c6069-70e8-4028-a6a3-70767e2a7d92","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.771229Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:9067b46d1439910c8c3172a026122762fb82a9e438ceb09cff7a743b784d77d0","observation_id":"77b5e56c-d43d-4687-8b2a-af2164a672c6","resolution":{"observed_at":"2026-08-08T11:17:17.068149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.051648Z","title":"Stadie, Ge Yang, Rein Houthooft, Xi Chen, Yan Duan, Yuhuai Wu, Pieter Abbeel, and Ilya Sutskever","venue":null,"work_id":"754cebb6-2e95-4b49-8ff0-63bde366ecdf","year":2019},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.774526Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:dfe7431ac7428b8f733f5b0e53d848e585abcea9c904484d6a0f3fb867ead77a","observation_id":"09d39497-c5fa-40ba-aec0-2f3cc28a251c","resolution":{"observed_at":"2026-08-08T11:17:17.055910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.038967Z","title":"Reinforcement Learning: An Introduction (2nd Edition)","venue":null,"work_id":"b077891d-c55e-4f07-9604-225917c36a06","year":2018},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.777661Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:e62767d2130e918de9e53bc619d8736330b105094b08a441380ec23f1eec56ff","observation_id":"5ceb6185-b8ab-4e50-a7cc-365651f8b86d","resolution":{"observed_at":"2026-08-08T11:17:17.042916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.028517Z","title":null,"venue":null,"work_id":"fd73ba98-287d-4d4c-bb58-d266c7b0db44","year":1988},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.780792Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:8dabecc4acdb51091586ab44123d5acb63d0be11ca61ad654369d17906395b2c","observation_id":"226e5757-ad40-4cc5-894c-288d4c33ad5d","resolution":{"observed_at":"2026-08-08T11:17:17.031817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.017999Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"42eae6ab-00cc-4528-bace-6cd7eaf3d075","year":2012},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.783930Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:54d16d3e40f37eb204a7f5d2ddc9ace83d1ca4cf138bb28225abca0b11d63ae0","observation_id":"2891a65e-027e-4964-8b55-05cd128c3343","resolution":{"observed_at":"2026-08-08T11:17:17.021079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:17.007710Z","title":"Tsitsiklis and Benjamin Van Roy","venue":null,"work_id":"fd606fe2-e0ff-4f2f-b849-34d5178c6edf","year":1999},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.787602Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:514173c79c8a8cdf6fdfaf0789eb74dcc99abdadc08d412d995c2e897c2810a4","observation_id":"82c2755a-032d-4538-a535-19a161be12e9","resolution":{"observed_at":"2026-08-08T11:17:17.011052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.790910Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.790910Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:7553c710090e1247d43d652df2633a72858a06a7675230747342ba6f7f4e12cb","observation_id":"84a2644d-7168-4393-bcfa-ccf442a12bba","resolution":{"observed_at":"2026-08-08T11:17:16.790910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.989918Z","title":"Wang, Zeb Kurth-Nelson , Dhruva Tirumala, Hubert Soyer, Joel Z","venue":null,"work_id":"70a21998-d85b-440a-9234-bbc135c102d7","year":2016},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.793962Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:361c12c7a5cfe8e14ab79e420201a164899166151a84ef06a33566f15c420219","observation_id":"4794ef81-e0bb-4c3e-add4-c925b9ef8773","resolution":{"observed_at":"2026-08-08T11:17:16.993524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.980024Z","title":"Transformers Learn Temporal Difference Methods for In-Context Reinforcement Learning","venue":null,"work_id":"98e02fff-1670-4f05-92fa-f0148da1609f","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.796930Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:e96675bcdc4020643720c6471dfbdf8cbb9e8a13a78b3ac762a16cbd6e92af0d","observation_id":"281bf302-ecac-481b-9828-ff0df44a7a72","resolution":{"observed_at":"2026-08-08T11:17:16.983690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.969719Z","title":"Hierarchical Prompt Decision Transformer : Improving Few-Shot Policy Generalization with Global and Adaptive Guidance","venue":null,"work_id":"07639eeb-c0f8-48a2-91fe-368b5fc7a454","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.799992Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:ff0e8b4842ebc41fe3dbf746fe8aa87d8fe3721e86d8dab17c2ab806e9be09b0","observation_id":"195591af-9331-4fb6-9745-9fabfa569286","resolution":{"observed_at":"2026-08-08T11:17:16.973320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.959525Z","title":"Large Sequence Models for Sequential Decision-Making : A Survey","venue":null,"work_id":"532ce133-93f9-4d1f-8180-93d148432c8a","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.803045Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:07d0bacf6420c73da156263abe82caf8888664902c20227ce2a86abade349bf1","observation_id":"bfec3a4b-656f-4071-9126-7509ec8a0c10","resolution":{"observed_at":"2026-08-08T11:17:16.963309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.948691Z","title":"Tenenbaum, and Chuang Gan","venue":null,"work_id":"2c10f0ef-efbd-4780-9f28-53c47b8a2eee","year":2022},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.806279Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:0c095281bb586879a46bc0b153138fe6bb49dfe7cd0909f0a1758a5832bab7f8","observation_id":"435ea215-b39f-41f1-853c-6112f6434591","resolution":{"observed_at":"2026-08-08T11:17:16.952484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.936121Z","title":"Meta- Reinforcement Learning Robust to Distributional Shift Via Performing Lifelong In-Context Learning","venue":null,"work_id":"5fc3a47f-e4cb-482f-be73-87ff8649fd13","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.808846Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:177b733d4e658a9ede0c5a9d3b1ab303de6c4ce08026eeaa7ffe4f4a60f258c3","observation_id":"b94d2d2c-ef44-4cd2-8d88-c960a499e755","resolution":{"observed_at":"2026-08-08T11:17:16.939818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.924070Z","title":"Meta- World : A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","venue":null,"work_id":"2be26fc4-9563-4120-8c3d-bc6dad8980cc","year":2021},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.811685Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:adc69806ed318cec9bcd87bfbb1dd38ad72ce351900beca23048065078bfaae2","observation_id":"3e2a8c8a-dad3-4c8d-8787-446bf36d3ccf","resolution":{"observed_at":"2026-08-08T11:17:16.928109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.912200Z","title":"A survey on model compression for large language models","venue":null,"work_id":"fc1864ba-7094-438d-92e3-e864acf17523","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.814691Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:761cd8079ab73cf6453dfa1d478d4020a3ce1205612d4ba8d72e7283ca049b93","observation_id":"97ca88a2-3481-4a08-b4c5-bd4b4ffbaa1e","resolution":{"observed_at":"2026-08-08T11:17:16.916455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.900290Z","title":"Zintgraf, Kyriacos Shiarlis, Maximilian Igl, Sebastian Schulze, Yarin Gal, Katja Hofmann, and Shimon Whiteson","venue":null,"work_id":"6153de01-3021-428f-a074-1f5eebba7582","year":2020},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.817728Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:48ce2d144a3bf8134a905a258db86a64be261c0ecaf7118a8911ab43e27a3e99","observation_id":"5af23720-b35c-4605-bb0c-59d9d09147c3","resolution":{"observed_at":"2026-08-08T11:17:16.904377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.890378Z","title":"Emergence of In-Context Reinforcement Learning from Noise Distillation","venue":null,"work_id":"0b5c6cb6-d43f-49e6-b540-0d365b3070b4","year":2023},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.820301Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:c3f19e1b55a8c27ba89779fe19e48d84b6eddabbc60e8ba76ab69b69d03f5733","observation_id":"dfa01cda-48a1-4e2a-872c-1bf8f700b99f","resolution":{"observed_at":"2026-08-08T11:17:16.893835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.880550Z","title":"N- Gram Induction Heads for In-Context RL : Improving Stability and Reducing Data Needs","venue":null,"work_id":"a519e63e-a1c3-4f4c-bb4a-958de97c70b7","year":2024},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.822902Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:4de87a65a8dc27a0943623a71dcfa3a3caa4e06f3a3b4c3b3b97d6283d2e043b","observation_id":"924b8fcc-6729-4f80-acab-4814a72f0e5d","resolution":{"observed_at":"2026-08-08T11:17:16.883528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:17:16.825411Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:16.825411Z"},"links":{"citing_paper":"/paper/2502.07978"},"observation_digest":"sha256:0e7769cb27a3b15443556f43f9a14176efc192f118f4394b47d61bf8def4c55c","observation_id":"5e73efff-96b8-4f8a-a685-b580af5a54d5","resolution":{"observed_at":"2026-08-08T11:17:16.825411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T20:41:10.087154Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":66},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 14 inbound Pith citation observations for arXiv:2502.07978."}