{"as_of":"2026-08-10T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e237e98db22c607bc84a76d6ad56ed15b4f322b7e0ec604c277310bcfdce540","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:41:16.343541Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:21:39.299158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T07:37:04.719767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02332","snapshot_observed_at":"2026-08-07T14:21:39.299158Z","title":"Toso, and James Anderson","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19426","last_updated":"2025-06-05T08:20:31Z","snapshot_observed_at":"2026-08-09T15:38:55.027294Z","submitted_at":"2025-05-26T02:37:26Z","title":"The Role of Diversity in In-Context Learning for Large Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:21:39.299158Z"},"links":{"cited_paper":"/paper/2502.02332","citing_paper":"/paper/2505.19426"},"observation_digest":"sha256:7a66bf65c89d328b741d11dd5490fd6593161ad125905d82b2b50510136c7e1e","observation_id":"2917b736-4708-4d6c-a94e-839588e3bc20","resolution":{"observed_at":"2026-08-07T14:21:39.299158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02332","snapshot_observed_at":"2026-08-06T18:20:57.142267Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09026","last_updated":"2025-07-11T21:19:47Z","snapshot_observed_at":"2026-08-10T11:51:49.562909Z","submitted_at":"2025-07-11T21:19:47Z","title":"On the Gradient Domination of the LQG Problem","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:57.142267Z"},"links":{"cited_paper":"/paper/2502.02332","citing_paper":"/paper/2507.09026"},"observation_digest":"sha256:0e24465927d1d5735ab2506b89a8ce41f2146af40522cb9b011b8d4893dfe369","observation_id":"f129d589-0c70-4fce-9cee-63627b49746a","resolution":{"observed_at":"2026-08-06T18:20:57.142267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.02332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02332","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","venue":null,"work_id":"116cd78a-fcd8-4774-b18d-4f3cf7d9334b","year":2025},"citing_paper":{"arxiv_id":"2604.16730","last_updated":"2026-04-17T22:25:00Z","snapshot_observed_at":"2026-07-31T07:35:19.162172Z","submitted_at":"2026-04-17T22:25:00Z","title":"Multitask LQG Control: Performance and Generalization Bounds","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T07:34:29.215557Z"},"links":{"cited_paper":"/paper/2502.02332","citing_paper":"/paper/2604.16730"},"observation_digest":"sha256:5f6d30e6768cc18803d18d706b6b1f9dd0da57448e057e45eaf413c5c9e40148","observation_id":"bf50c772-4d04-4a30-a485-46555d042a65","resolution":{"observed_at":"2026-05-10T07:37:04.721129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02332/citation-record","integrity":"/paper/2502.02332/integrity","json":"/paper/2502.02332/citation-record.json","paper":"/paper/2502.02332"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.17364","last_updated":"2024-10-07T05:04:42Z","snapshot_observed_at":"2026-08-10T11:48:47.800993Z","submitted_at":"2024-03-26T04:02:09Z","title":"A Moreau Envelope Approach for LQR Meta-Policy Estimation","version":2},"cited_work":{"arxiv_id":"2403.17364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17364","snapshot_observed_at":"2026-08-09T12:41:16.609390Z","title":"A Moreau Envelope Approach for LQR Meta-Policy Estimation","venue":"math.OC","work_id":"dc2e2806-729e-4b14-b644-65f2f3684da2","year":2024},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.255331Z"},"links":{"cited_paper":"/paper/2403.17364","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:640b5c62cc630647a780c6454f207cf1200d9195bcccc065f09787f1b09619e0","observation_id":"83a894ad-c0cc-443e-803a-3fbe0796018d","resolution":{"observed_at":"2026-08-09T12:41:16.612679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.697088Z","title":"In addition, since the tasks Tj ∈ Mand samples u ∼ Sr are drawn independently, we can use Lemma 3 to control ∥∇ ˜J(θ) − e∇J(θ)∥","venue":null,"work_id":"5d64309d-97e0-4b3a-8ef5-ddb289b25715","year":2004},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.340243Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:896de5eddc1ba61500102d741f252c0a2685b2fb507fe6217c53460e33c436d3","observation_id":"769b3d2b-abaa-491b-9c15-3297e53bf845","resolution":{"observed_at":"2026-08-09T12:41:16.699807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06588","last_updated":"2023-09-15T17:22:59Z","snapshot_observed_at":"2026-08-10T11:48:21.584043Z","submitted_at":"2023-09-12T20:24:37Z","title":"Convergence of Gradient-based MAML in LQR","version":2},"cited_work":{"arxiv_id":"2309.06588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.06588","snapshot_observed_at":"2026-08-09T12:41:16.564701Z","title":"Convergence of Gradient-based MAML in LQR","venue":"eess.SY","work_id":"d383d104-9fa6-477a-8b86-d1987a2556a1","year":2023},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.280006Z"},"links":{"cited_paper":"/paper/2309.06588","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:ecb95c848affba58fb20cd9a35861ebc971e3bcfbfafc605e2036f197be83719","observation_id":"f211665e-8452-4eed-b456-84b9c23f6d99","resolution":{"observed_at":"2026-08-09T12:41:16.568537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05465","last_updated":"2023-12-09T04:52:28Z","snapshot_observed_at":"2026-08-10T11:48:49.383554Z","submitted_at":"2023-12-09T04:52:28Z","title":"On Task-Relevant Loss Functions in Meta-Reinforcement Learning and Online LQR","version":1},"cited_work":{"arxiv_id":"2312.05465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.05465","snapshot_observed_at":"2026-08-09T12:41:16.514937Z","title":"On Task-Relevant Loss Functions in Meta-Reinforcement Learning and Online LQR","venue":"cs.LG","work_id":"08515e34-c32f-4923-89ec-0b652dca3059","year":2023},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.296359Z"},"links":{"cited_paper":"/paper/2312.05465","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:6675e89b68e04c6425527677561f6fb85d80aff8aea19434ba051f9f8f041fb5","observation_id":"d1ca02f1-a0f4-4e97-8ac8-47f4619e50aa","resolution":{"observed_at":"2026-08-09T12:41:16.518542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01215","last_updated":"2020-07-07T15:49:16Z","snapshot_observed_at":"2026-08-10T11:48:33.158830Z","submitted_at":"2019-09-25T19:28:33Z","title":"ES-MAML: Simple Hessian-Free Meta Learning","version":4},"cited_work":{"arxiv_id":"1910.01215","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01215","snapshot_observed_at":"2026-08-09T12:41:16.501102Z","title":"ES-MAML: Simple Hessian-Free Meta Learning","venue":"cs.LG","work_id":"f6b02f18-5399-4737-9444-aceb78be9297","year":2019},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.299019Z"},"links":{"cited_paper":"/paper/1910.01215","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:83dbb7b7e7cb6117c100d01f0f93d6e302b834ddf5b1e1bdabcd85dd3acc33b3","observation_id":"3878cfaf-8ffb-4473-9ad2-9dc6edbae164","resolution":{"observed_at":"2026-08-09T12:41:16.504815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.740586Z","title":null,"venue":null,"work_id":"636c4e85-176a-4be0-9a01-e1f67b999aee","year":2020},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.301946Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:4714c0c4bcb412de24f9227157cb9006d40dad19aa2afa0817b428d4485875ef","observation_id":"193b88e8-d9d9-4c97-802c-630697e45e68","resolution":{"observed_at":"2026-08-09T12:41:16.743461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.732191Z","title":"Todorov, T","venue":null,"work_id":"b2fed71d-6c22-4e30-91fc-319dbc986031","year":2012},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.307348Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:a79146c5fd4467a777a4230c24d103d158be89615dd7ee27d9e8286eb7f9293b","observation_id":"f590d168-8a52-478d-b5e2-005fb8743c75","resolution":{"observed_at":"2026-08-09T12:41:16.735238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09061","last_updated":"2024-04-13T19:07:25Z","snapshot_observed_at":"2026-07-06T17:59:46.583076Z","submitted_at":"2024-04-13T19:07:25Z","title":"Asynchronous Heterogeneous Linear Quadratic Regulator Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09061","snapshot_observed_at":"2026-08-09T12:41:16.313536Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.313536Z"},"links":{"cited_paper":"/paper/2404.09061","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:135498053e9171e1cac13ccf643229fc327ea004897591a3e434e98f2a1edc7b","observation_id":"8d3f7c0a-c14d-4f2b-9000-024cde167d65","resolution":{"observed_at":"2026-08-09T12:41:16.313536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11743","last_updated":"2023-08-22T19:09:29Z","snapshot_observed_at":"2026-07-06T16:09:16.990194Z","submitted_at":"2023-08-22T19:09:29Z","title":"Model-free Learning with Heterogeneous Dynamical Systems: A Federated LQR Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11743","snapshot_observed_at":"2026-08-09T12:41:16.317786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.317786Z"},"links":{"cited_paper":"/paper/2308.11743","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:c16cf4eca146d1d5b52cfa2e3100c06dc4467d4ac1d887086dd92abb2f9d2068","observation_id":"4bbc1440-88e4-4b5c-8f6e-a619151f96fe","resolution":{"observed_at":"2026-08-09T12:41:16.317786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05763","last_updated":"2017-01-23T12:38:24Z","snapshot_observed_at":"2026-07-06T05:19:05.390653Z","submitted_at":"2016-11-17T16:29:11Z","title":"Learning to reinforcement learn","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05763","snapshot_observed_at":"2026-08-09T12:41:16.321039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.321039Z"},"links":{"cited_paper":"/paper/1611.05763","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:0d648fb0e361f6416d1265f5e8bf77c44ef2decbf7a2aa3a67ff503df7e73a70","observation_id":"1e08c7a4-f181-422c-a174-e211a0047564","resolution":{"observed_at":"2026-08-09T12:41:16.321039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02453","last_updated":"2017-05-15T13:37:58Z","snapshot_observed_at":"2026-08-02T03:10:11.472239Z","submitted_at":"2017-02-08T14:53:45Z","title":"Preparing for the Unknown: Learning a Universal Policy with Online System Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02453","snapshot_observed_at":"2026-08-09T12:41:16.327376Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.327376Z"},"links":{"cited_paper":"/paper/1702.02453","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:5d0304788182a5ef06da5454831f6c41b6ea043c5fc6c2687118f5f9366dd643","observation_id":"93e3e295-2284-4bc7-9c67-c79d23b8c133","resolution":{"observed_at":"2026-08-09T12:41:16.327376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.723112Z","title":null,"venue":null,"work_id":"c80cc82f-627b-44d0-8b45-ce1ad3a52ccf","year":2012},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.330573Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:6a7ebea1ec12305bb05ec04739549852d01a27d9eeae102554792a3e02f7bc83","observation_id":"e65bbd3d-9c58-443b-985f-8e633cfa548a","resolution":{"observed_at":"2026-08-09T12:41:16.726379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.714182Z","title":"Similarly, we consider a zeroth-order estimation of the task-specific and meta-gradients","venue":null,"work_id":"ca94d8ec-4a53-4abb-8f32-d34654a6ea19","year":2020},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.333811Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:8d19e8f40b8dfbc7960c81e22eefadbcc3921964f9d20508b48eebc691b7139d","observation_id":"fdef6025-f4a8-46eb-af6e-e9eba6dc0df0","resolution":{"observed_at":"2026-08-09T12:41:16.717525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.704944Z","title":"In particular, Zhan and Anderson (2024) does not focus on RL tasks and approximates gradients using the pre-activation outputs of the last layer for classification tasks","venue":null,"work_id":"a2fb86ed-821c-43ba-8e53-a37d6114d59b","year":2024},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.336860Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:b4158574a8a29d0abff7c8e824e178ab3319f84696cdf253986d6bf7a7dac78f","observation_id":"0c3ee682-260a-4157-b3b6-76d762456184","resolution":{"observed_at":"2026-08-09T12:41:16.708357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.618347Z","title":"In particular, by (Nemhauser et al., 1978, Section 4), we know that the value of the greedy optimization is close to the optimal as F (S) ≥ (1 − e−1)F (S ⋆)","venue":null,"work_id":"25f1c298-4133-4f2c-aec0-3f7f5370d45b","year":1978},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.343541Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:131e957c2b85a0bca654df45b9353e7c2263c22e2589653babd973b1ad0bf0d9","observation_id":"541fb82d-e91d-40e8-bd93-ed2b6d521514","resolution":{"observed_at":"2026-08-09T12:41:16.691779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-07-06T06:41:03.009337Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-09T12:41:16.304744Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":1972,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.304744Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:dd6709a88a5945022319339b8486c32ac9250121b8c7f1c05a13c0642041b7c6","observation_id":"d16211cd-049a-426d-98ec-920c9391e652","resolution":{"observed_at":"2026-08-09T12:41:16.304744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-09T12:41:16.262932Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":1977,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.262932Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:ecc19d2ff715d0388b3293800e513036da92d9cf23e0f09b57fa10250db689a7","observation_id":"717ff867-224f-405a-96f1-d1756a0b97e8","resolution":{"observed_at":"2026-08-09T12:41:16.262932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01244","last_updated":"2023-06-02T02:51:08Z","snapshot_observed_at":"2026-07-06T15:36:56.786182Z","submitted_at":"2023-06-02T02:51:08Z","title":"Towards Sustainable Learning: Coresets for Data-efficient Deep Learning","version":1},"cited_work":{"arxiv_id":"2306.01244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.01244","snapshot_observed_at":"2026-08-09T12:41:16.377044Z","title":"Towards Sustainable Learning: Coresets for Data-efficient Deep Learning","venue":"cs.LG","work_id":"e01ab11f-6412-4e4c-a7ac-fb55e2b87bb4","year":2023},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.324159Z"},"links":{"cited_paper":"/paper/2306.01244","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:04364680a9d15ccf3a44d4cd71bd5a7661330d75cb781d7fcd3ba248f08ec74a","observation_id":"6891ec4a-d16d-4268-b9fb-a4ff3513d739","resolution":{"observed_at":"2026-08-09T12:41:16.382388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.757368Z","title":"Ghadirzadeh, X","venue":null,"work_id":"739d75de-4199-476c-a0fa-8a0f42ead18b","year":2021},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.270230Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:3397cb1ebd42d64835f0d712865e83745b019596c39b2e6ea888f20bd60564b6","observation_id":"31580378-edfb-42fa-aa61-c4e5240a3e25","resolution":{"observed_at":"2026-08-09T12:41:16.760488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.310440Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.310440Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:1119342d6bb517fc78ae8d4f99d63dcd8baf31cba6b99fe3decaa461df309b86","observation_id":"e4147cd9-8d15-42da-8611-1c2d17d3361b","resolution":{"observed_at":"2026-08-09T12:41:16.310440Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0408007","last_updated":"2004-08-02T21:24:41Z","snapshot_observed_at":"2026-07-07T03:05:55.751870Z","submitted_at":"2004-08-02T21:24:41Z","title":"Online convex optimization in the bandit setting: gradient descent without a gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0408007","snapshot_observed_at":"2026-08-09T12:41:16.266680Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.266680Z"},"links":{"cited_paper":"/paper/cs/0408007","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:075b930a5d861c64faf148fa2ecf0973ef2b2620515e7fd5916424682ceadcd2","observation_id":"20a48c14-9dd9-4d01-85ed-f346d38eecbc","resolution":{"observed_at":"2026-08-09T12:41:16.266680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-09T12:41:16.293835Z","title":"Salimans, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.293835Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:58994c5f8fcc3d2c76f32b8cbf51f5240ac362581ad5575fc6e42b34cd08775b","observation_id":"950b26bd-ec76-43cb-863a-d75dede55322","resolution":{"observed_at":"2026-08-09T12:41:16.293835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17370","last_updated":"2024-05-27T17:26:36Z","snapshot_observed_at":"2026-08-02T18:12:33.896881Z","submitted_at":"2024-05-27T17:26:36Z","title":"Model-Agnostic Zeroth-Order Policy Optimization for Meta-Learning of Ergodic Linear Quadratic Regulators","version":1},"cited_work":{"arxiv_id":"2405.17370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17370","snapshot_observed_at":"2026-08-09T12:41:16.543293Z","title":"Model-Agnostic Zeroth-Order Policy Optimization for Meta-Learning of Ergodic Linear Quadratic Regulators","venue":"eess.SY","work_id":"ff6f8b3a-b2c5-4b2e-8443-d2cc6856db8f","year":2024},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.286597Z"},"links":{"cited_paper":"/paper/2405.17370","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:9bbdd068605a924c5e294c887e65cd1f658b51b4452d941640656d649706ae15","observation_id":"60afd4cf-fc84-425b-a81b-d6378224086c","resolution":{"observed_at":"2026-08-09T12:41:16.546856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.748851Z","title":"Molybog and J","venue":null,"work_id":"e80d00de-f7c3-4e6c-8a26-3903edf0be15","year":2021},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.276849Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:7859232a7f6b0962d9d450b0c040fa1c5bfe5d574ce4fe9c8a270f86fe0db2bd","observation_id":"e677a2c4-bb87-46bd-b14d-80941775f01e","resolution":{"observed_at":"2026-08-09T12:41:16.751760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05781","last_updated":"2024-07-27T13:20:35Z","snapshot_observed_at":"2026-07-06T18:42:51.512751Z","submitted_at":"2024-07-08T09:41:42Z","title":"Regret Analysis of Multi-task Representation Learning for Linear-Quadratic Adaptive Control","version":2},"cited_work":{"arxiv_id":"2407.05781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05781","snapshot_observed_at":"2026-08-09T12:41:16.578455Z","title":"Regret Analysis of Multi-task Representation Learning for Linear-Quadratic Adaptive Control","venue":"cs.LG","work_id":"dd29e80a-fce1-4daf-95df-eecd92fbc403","year":2024},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.273471Z"},"links":{"cited_paper":"/paper/2407.05781","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:29aadeff0580c0954618e986af60d1754b9ce78d8f5fcd98158d01d7eeebb5ac","observation_id":"3e18d678-9ac9-4c17-b79d-6a338a50c806","resolution":{"observed_at":"2026-08-09T12:41:16.582194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06784","last_updated":"2022-02-11T12:46:43Z","snapshot_observed_at":"2026-08-05T10:35:49.233307Z","submitted_at":"2018-10-16T01:43:51Z","title":"ProMP: Proximal Meta-Policy Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06784","snapshot_observed_at":"2026-08-09T12:41:16.290464Z","title":"Rothfuss, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.290464Z"},"links":{"cited_paper":"/paper/1810.06784","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:6fd351d47f5ac2887b56c8867b0dcf4084e7392deb1701b48f191a49db08e825","observation_id":"43842f06-ef58-4d52-8548-fe6d27187a1d","resolution":{"observed_at":"2026-08-09T12:41:16.290464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11347","last_updated":"2019-02-27T19:23:41Z","snapshot_observed_at":"2026-08-07T15:15:34.263627Z","submitted_at":"2018-03-30T05:47:11Z","title":"Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11347","snapshot_observed_at":"2026-08-09T12:41:16.283396Z","title":"Nagabandi, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.283396Z"},"links":{"cited_paper":"/paper/1803.11347","citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:04a0d6f3434ece8a3942132316e84251b33ee1865f5f6fe840b1afaababc6bd4","observation_id":"97f5af7c-3914-408f-b80e-0b889800e6a0","resolution":{"observed_at":"2026-08-09T12:41:16.283396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:41:16.765878Z","title":"Arndt, M","venue":null,"work_id":"e47415c4-c4f8-4d49-bf55-20e27e5d6f26","year":2020},"citing_paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T12:41:16.259556Z"},"links":{"citing_paper":"/paper/2502.02332"},"observation_digest":"sha256:b18b386bf7f9051b2364596b9b95066cae8f43176c8e64a98f3434c13403f6d1","observation_id":"d0db18d1-6b0e-4977-b53c-8e3a994c9eae","resolution":{"observed_at":"2026-08-09T12:41:16.768753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02332","last_updated":"2025-04-11T18:06:15Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-10T11:48:09.209218Z","submitted_at":"2025-02-04T14:09:00Z","title":"Coreset-Based Task Selection for Sample-Efficient Meta-Reinforcement Learning"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":7,"verified_fuzzy":8},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2502.02332."}