{"as_of":"2026-08-14T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c88eea19b3a9b76ad0714acd382d8039d2b43559f2e5d25667399823a5b37ca9","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:03:33.026420Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:46:28.503923Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20061","snapshot_observed_at":"2026-07-13T00:46:28.503923Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09042","last_updated":"2026-07-10T02:17:41Z","snapshot_observed_at":"2026-08-13T08:14:55.390597Z","submitted_at":"2026-07-10T02:17:41Z","title":"Learning More from Less: Reinforcement Learning from Hindsight","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:28.503923Z"},"links":{"cited_paper":"/paper/2506.20061","citing_paper":"/paper/2607.09042"},"observation_digest":"sha256:1c8189ace4f8d42808d69cf788ca26d25e4ba60353864325c7ca576a3af3451a","observation_id":"0e39e0b9-01c2-4be0-9674-7f933d8fded8","resolution":{"observed_at":"2026-07-13T00:46:28.503923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20061/citation-record","integrity":"/paper/2506.20061/integrity","json":"/paper/2506.20061/citation-record.json","paper":"/paper/2506.20061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:35.714342Z","title":"Universal value function approximators","venue":null,"work_id":"4d30e93f-3109-436c-9bf9-fab56a1337bf","year":2015},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.373096Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:133ada6353f34bb415d64d9a2a224292cecde68cca9161448af6de92d799f4be","observation_id":"ee5ef227-57f1-48ca-94f1-05a33cc845a6","resolution":{"observed_at":"2026-08-06T23:03:35.816841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:29.500447Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.500447Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:8ab533502b764c60282d28864a754e4d4f85752ac30bf247a443e6cd8ac075f0","observation_id":"a7e33da3-9a98-4b9b-9623-c7aba574a393","resolution":{"observed_at":"2026-08-06T23:03:29.500447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09382","last_updated":"2020-05-19T12:16:58Z","snapshot_observed_at":"2026-08-12T10:22:53.052121Z","submitted_at":"2020-05-19T12:16:58Z","title":"Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09382","snapshot_observed_at":"2026-08-06T23:03:29.615893Z","title":"Human instruction-following with deep reinforcement learning via transfer-learning from text","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.615893Z"},"links":{"cited_paper":"/paper/2005.09382","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:6c02ed098a0dc15627583c95e5f0223882589799708c5a88dd42da7e5e39af97","observation_id":"f9e5e4fc-9e4b-413a-b71b-5f24f81619dc","resolution":{"observed_at":"2026-08-06T23:03:29.615893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:35.445073Z","title":"Grounding language for transfer in deep reinforcement learning","venue":null,"work_id":"59b11f8a-1857-4a45-b470-cb5fdb37dbf4","year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.777682Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:5d93fb1ad49e03533e655fa63c7ac1eacba306089c04a56ca73c24362e4136ec","observation_id":"ce835828-b91f-43ec-9f59-4485abcca790","resolution":{"observed_at":"2026-08-06T23:03:35.565489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16801","last_updated":"2024-06-03T14:12:27Z","snapshot_observed_at":"2026-08-13T04:09:49.312332Z","submitted_at":"2024-02-26T18:19:07Z","title":"Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16801","snapshot_observed_at":"2026-08-06T23:03:29.905488Z","title":"Craftax: A lightning-fast benchmark for open-ended reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:29.905488Z"},"links":{"cited_paper":"/paper/2402.16801","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:f5ff042a8f1dfeda7f7e8c97d59e5a671cad51620ce50bfbfa1608f0a2853785","observation_id":"37532636-43af-4b52-8434-53dd47ee7afa","resolution":{"observed_at":"2026-08-06T23:03:29.905488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08299","last_updated":"2022-09-02T10:46:40Z","snapshot_observed_at":"2026-08-13T16:55:37.923698Z","submitted_at":"2022-01-20T17:06:42Z","title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08299","snapshot_observed_at":"2026-08-06T23:03:30.107695Z","title":"Goal-conditioned reinforcement learning: Problems and solutions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.107695Z"},"links":{"cited_paper":"/paper/2201.08299","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:501e2e4c93d2d56520c5bab3df25425de5520927dda81d3f1937e1107d9aac86","observation_id":"7974a871-e96a-47a5-9f66-4fe6ab15f670","resolution":{"observed_at":"2026-08-06T23:03:30.107695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:35.226837Z","title":"Maximum entropy gain exploration for long horizon multi-goal reinforcement learning","venue":null,"work_id":"133e5da6-8296-4124-917c-60f4495c7329","year":2020},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.241905Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:b670890a38a5d56c20c7122ce9f20e59d98ae387c1953e50c8ca92ded9bf101d","observation_id":"b101b800-f6c9-4d69-9320-e99fe1209ddf","resolution":{"observed_at":"2026-08-06T23:03:35.295432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:30.378167Z","title":"Curriculum-guided hindsight experience replay","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.378167Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:9cb778387a9546fc6166daec9e93eb647fe3af50281459497f805240109ccd5d","observation_id":"ef5a2712-587e-4d1b-b38e-843eac71b0c4","resolution":{"observed_at":"2026-08-06T23:03:30.378167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:30.546500Z","title":"Exploration via hindsight goal generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.546500Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:273b3acccc488bc27ed24fe49a647d1c7b854468dcb62b3c8e4a2b2399177a54","observation_id":"38706882-630a-49cd-93d4-47fb0f010657","resolution":{"observed_at":"2026-08-06T23:03:30.546500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:30.719316Z","title":"Visual reinforcement learning with imagined goals","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.719316Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:3490c6ce503331bf5400b8302b1afb4a255f2519400601a8490acdeb165bb3fa","observation_id":"cb3ba943-5387-44ad-bab6-55dd54832e3f","resolution":{"observed_at":"2026-08-06T23:03:30.719316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11359","last_updated":"2018-11-28T02:35:24Z","snapshot_observed_at":"2026-07-06T07:17:31.201039Z","submitted_at":"2018-11-28T02:35:24Z","title":"Unsupervised Control Through Non-Parametric Discriminative Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.11359","snapshot_observed_at":"2026-08-06T23:03:30.883300Z","title":"Unsupervised control through non-parametric discriminative rewards","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:30.883300Z"},"links":{"cited_paper":"/paper/1811.11359","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:5d6dfdf04fc280d85b1125d69ff167a6dfb9d2d23c386bd1bd5b932bf7549b7a","observation_id":"0676bdcf-9d3c-4064-a8a6-e31cf92c2201","resolution":{"observed_at":"2026-08-06T23:03:30.883300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03926","last_updated":"2019-06-10T12:17:45Z","snapshot_observed_at":"2026-08-14T16:18:11.174755Z","submitted_at":"2019-06-10T12:17:45Z","title":"A Survey of Reinforcement Learning Informed by Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.03926","snapshot_observed_at":"2026-08-06T23:03:31.066702Z","title":"A survey of reinforcement learning informed by natural language","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.066702Z"},"links":{"cited_paper":"/paper/1906.03926","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:fcf80b8342862ddb8855ef8548557fd6d60774b359165432a08792c81c612c77","observation_id":"9d332c08-ac5d-4255-8d10-a5b3c3b91e42","resolution":{"observed_at":"2026-08-06T23:03:31.066702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:34.870026Z","title":"The wisdom of hindsight makes language models better instruction followers","venue":null,"work_id":"6296ea4b-e8b2-40ad-b5c1-b2ceedca998c","year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.203145Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:37c24a938e8c6303b338bfd47f8b51d6e85b51841232060cbcaab53801001c43","observation_id":"cfa8ee4d-b0b4-4fb2-b154-95b72e688eac","resolution":{"observed_at":"2026-08-06T23:03:35.061171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09889","last_updated":"2023-05-17T01:55:08Z","snapshot_observed_at":"2026-08-13T11:40:37.182589Z","submitted_at":"2023-05-17T01:55:08Z","title":"Analyzing the Stance of Facebook Posts on Abortion Considering State-level Health and Social Compositions","version":1},"cited_work":{"arxiv_id":"2305.09889","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09889","snapshot_observed_at":"2026-08-06T23:03:33.266902Z","title":"Analyzing the Stance of Facebook Posts on Abortion Considering State-level Health and Social Compositions","venue":"cs.SI","work_id":"b59051c3-0bd6-4aaa-a6b9-c88ea10b3823","year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.331751Z"},"links":{"cited_paper":"/paper/2305.09889","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:4da736aa7fc996424bf95a849458c702c8071b7bec707b11d3e57d5fba015fe6","observation_id":"6d3a108f-8727-45c9-92fd-7970ba17c401","resolution":{"observed_at":"2026-08-06T23:03:33.440232Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-06T23:03:31.451743Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.451743Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:a071a362592b98ef825f3c33b80ff7d2eb8a062f4561a3428ca113b36b75fb66","observation_id":"154d05e9-42a3-44d3-a35f-73f261b2fe91","resolution":{"observed_at":"2026-08-06T23:03:31.451743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:34.589527Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"8c1b818e-7cc6-4648-88cc-bc0b589fa3da","year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.573213Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:dfb7ab26d845a78be085833c37dee851e6f0fdf374c0166dcfdce88c7a101205","observation_id":"ce92ba1f-c190-465b-bf2f-deb45477acf8","resolution":{"observed_at":"2026-08-06T23:03:34.726003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02515","last_updated":"2022-04-05T23:04:18Z","snapshot_observed_at":"2026-08-13T16:07:57.773039Z","submitted_at":"2022-04-05T23:04:18Z","title":"Inferring Rewards from Language in Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02515","snapshot_observed_at":"2026-08-06T23:03:31.747052Z","title":"Inferring rewards from language in context","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.747052Z"},"links":{"cited_paper":"/paper/2204.02515","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:6741379716b484f1e7d405206b6b198cd44ad2436704df0964607ded36376e18","observation_id":"87ef1c50-298c-4ceb-91aa-0af950e38492","resolution":{"observed_at":"2026-08-06T23:03:31.747052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:34.249711Z","title":"Guiding pretraining in reinforcement learning with large language models","venue":null,"work_id":"fb8ae188-fe14-4d5b-9c73-4744d9e067d5","year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:31.894792Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:14c32b4dee2c72ed212acd8186b5c92654907dcb28d9316719c6df9d5498cfb9","observation_id":"472cdb42-28bf-4cde-9f5a-e3c525469997","resolution":{"observed_at":"2026-08-06T23:03:34.435119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:32.011774Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.011774Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:0a1cc9d8f113f1a0950e51181ab0a075e519ffd217021ba3f51cad84275b7586","observation_id":"d4cb4566-d3f4-470e-87b5-8ecfd58751f8","resolution":{"observed_at":"2026-08-06T23:03:32.011774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:32.159440Z","title":"Minedojo: Building open-ended embodied agents with internet-scale knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.159440Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:a720094ab9bc6253e32b02cf6ede0ee656e359084d960ff0a24f12dc06d521fa","observation_id":"125b9fc7-cde6-42f3-bf25-12de208fc593","resolution":{"observed_at":"2026-08-06T23:03:32.159440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02077","last_updated":"2025-06-04T02:00:12Z","snapshot_observed_at":"2026-08-10T22:02:01.275530Z","submitted_at":"2025-03-03T21:58:10Z","title":"M3HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02077","snapshot_observed_at":"2026-08-06T23:03:32.302643Z","title":"M3hf: Multi-agent reinforcement learning from multi-phase human feedback of mixed quality","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.302643Z"},"links":{"cited_paper":"/paper/2503.02077","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:7b4b8f377f81c8ce5b1d3429413bb444e037f10d59dea4887fcf4540cb254c0c","observation_id":"4899dffe-6d59-40f4-b0e2-6883148a6f09","resolution":{"observed_at":"2026-08-06T23:03:32.302643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:33.961455Z","title":"Puterman","venue":null,"work_id":"2ebc74bc-9d1e-47cf-8c8a-e25cfdc3ced2","year":1994},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.436169Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:01772839c0aed8f05f0b5c2bda691cf269d1eb2456594746ebae53abaf8a2680","observation_id":"68263a5e-58f2-4328-8d97-e32ffec8b761","resolution":{"observed_at":"2026-08-06T23:03:34.043969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:32.619630Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.619630Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:adaa3c4aefd731d010d70ccec50075a7ecae68bf509eea5e27b2eefcd813ec80","observation_id":"5d3772f7-f1c5-4ac3-82f1-a90506281224","resolution":{"observed_at":"2026-08-06T23:03:32.619630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T23:03:32.776946Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.776946Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:d347f466c6c5c4f81536ce9e05f01f74ebe5f9cba096e1c8036713b4cbef85c8","observation_id":"c80792ea-c059-4d23-9320-953d70e826d4","resolution":{"observed_at":"2026-08-06T23:03:32.776946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-12T23:27:55.293597Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-06T23:03:32.888434Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:32.888434Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:d84f82bd27bbe3e909dbc5059fb35b5bd4f6662281fd622d9cbcf1a603990ca1","observation_id":"625ffa4f-d64e-42a5-9af4-316d21545853","resolution":{"observed_at":"2026-08-06T23:03:32.888434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:03:33.717803Z","title":"Prioritized level replay","venue":null,"work_id":"27a5ec05-30e9-46dd-ae9e-8c98488cbe26","year":2021},"citing_paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:03:33.026420Z"},"links":{"citing_paper":"/paper/2506.20061"},"observation_digest":"sha256:57ee1cb3eb149d7704de5c952b5dbaeb31d9eaec84c35b41fbce9c7a6eb464c8","observation_id":"191974e1-80f5-4535-ae57-ebc654313a33","resolution":{"observed_at":"2026-08-06T23:03:33.846448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20061","last_updated":"2025-06-24T23:49:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T17:48:05.768196Z","submitted_at":"2025-06-24T23:49:28Z","title":"Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2506.20061."}