{"as_of":"2026-08-10T05:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e9ca8d2ba43ed694ba42e784c493f7880100b09b15443f2aeef9fc2d98a19cc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:52:27.258667Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:06.257016Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":"2106.05091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-07-04T19:40:06.257016Z","title":"PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":"bb93267b-0a0c-49b6-8a2e-00a9e4565cd1","year":2021},"citing_paper":{"arxiv_id":"2310.15288","last_updated":"2026-05-07T22:20:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-23T18:54:43Z","title":"Active teacher selection for reward learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T05:54:43.873174Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2310.15288"},"observation_digest":"sha256:0e5115d620851608e6d6d1245231b83fae55121375a96275961753ff6dc4554b","observation_id":"006cde4c-6c80-49fd-81c9-d12af47de548","resolution":{"observed_at":"2026-05-24T05:56:01.750823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-09T14:52:27.258667Z","title":"Pebble: Feedback- efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01616","last_updated":"2025-02-03T18:50:15Z","snapshot_observed_at":"2026-08-10T03:41:18.504669Z","submitted_at":"2025-02-03T18:50:15Z","title":"Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T14:52:27.258667Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2502.01616"},"observation_digest":"sha256:58d1200bfbfbd1a0fe605121cadf7ed869b1db6138b4c37648ff17e69fdf7f5d","observation_id":"89384354-e872-455e-bf1e-cc4fd718b371","resolution":{"observed_at":"2026-08-09T14:52:27.258667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-09T05:02:13.213302Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03369","last_updated":"2025-02-05T17:07:37Z","snapshot_observed_at":"2026-08-09T12:36:37.004381Z","submitted_at":"2025-02-05T17:07:37Z","title":"Learning from Active Human Involvement through Proxy Value Propagation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T05:02:13.213302Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2502.03369"},"observation_digest":"sha256:9a63157287a16577f429859f0a0e54f7ea39972df6bc8f4381be8a7911326dac","observation_id":"480fa63f-cede-40c0-b88d-6a38f8e293db","resolution":{"observed_at":"2026-08-09T05:02:13.213302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-09T01:04:04.085762Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre- training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.085762Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:b7dd248d38bd35186d6985cc39c5c60793714916547c8d55e635e18a75320dbb","observation_id":"f5750ba4-345c-479c-b362-073007f18f0d","resolution":{"observed_at":"2026-08-09T01:04:04.085762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-09T01:03:56.977920Z","title":"Pebble: Feedback- efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03723","last_updated":"2025-03-01T01:43:31Z","snapshot_observed_at":"2026-08-09T00:55:51.557969Z","submitted_at":"2025-02-06T02:26:47Z","title":"Speaking the Language of Teamwork: LLM-Guided Credit Assignment in Multi-Agent Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T01:03:56.977920Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2502.03723"},"observation_digest":"sha256:ff22ae3e8a4efbd4fa12200698bb7da000ca92294a3a4490b3f48748ea6da904","observation_id":"67a4b0f7-931d-4a38-82ba-3573b732027a","resolution":{"observed_at":"2026-08-09T01:03:56.977920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-07T12:12:59.030007Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.030007Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:c91dd71bce024b8be8f3cd940bf31e3b967142da2ff80661961f28eb70cd5393","observation_id":"8190da58-22ab-43de-a3f7-162654f53e83","resolution":{"observed_at":"2026-08-07T12:12:59.030007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":"2106.05091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-07-04T19:40:06.257016Z","title":"PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":"bb93267b-0a0c-49b6-8a2e-00a9e4565cd1","year":2021},"citing_paper":{"arxiv_id":"2506.14648","last_updated":"2026-05-21T02:08:17Z","snapshot_observed_at":"2026-07-06T21:43:40.740750Z","submitted_at":"2025-06-17T15:42:19Z","title":"SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T13:27:48.404574Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2506.14648"},"observation_digest":"sha256:e688f0c4c53f94dd843c0376b077f3f4fdc2b8c0cf2d701548990fab9f8147a8","observation_id":"2a675f9e-6ba7-40da-b27d-cadf3d44b6e5","resolution":{"observed_at":"2026-05-22T13:31:36.503042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-06T21:17:36.384982Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00611","last_updated":"2025-07-01T09:43:57Z","snapshot_observed_at":"2026-08-06T21:08:39.566215Z","submitted_at":"2025-07-01T09:43:57Z","title":"Residual Reward Models for Preference-based Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:36.384982Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2507.00611"},"observation_digest":"sha256:4dab05d8e721b951a73d3332152a8434808af65bdc4a3f5529c4be13e532d18b","observation_id":"9f862af4-11fc-402b-ac64-e871402ee531","resolution":{"observed_at":"2026-08-06T21:17:36.384982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-06T19:46:57.368857Z","title":"PEBBLE: feedback- efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04730","last_updated":"2025-07-07T07:54:28Z","snapshot_observed_at":"2026-08-06T19:38:28.411769Z","submitted_at":"2025-07-07T07:54:28Z","title":"CueLearner: Bootstrapping and local policy adaptation from relative feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:57.368857Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2507.04730"},"observation_digest":"sha256:e179aac095162207ccd63bede2fa43d7530122197593e1c22404220ec5ac490d","observation_id":"ee2d89a7-e9a9-4d9b-ab0d-6fb0937dee98","resolution":{"observed_at":"2026-08-06T19:46:57.368857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-06T05:41:42.210585Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-08T15:25:20.465265Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.210585Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:7d544f3978e61a6e7fe6ea417b8194990f794c30bf6634bbb07ae85a2a1ced50","observation_id":"bf990ad4-6fe6-4e04-848f-c4f42f575879","resolution":{"observed_at":"2026-08-06T05:41:42.210585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-05T16:02:25.976213Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19132","last_updated":"2025-08-26T15:34:17Z","snapshot_observed_at":"2026-08-09T20:42:01.029212Z","submitted_at":"2025-08-26T15:34:17Z","title":"Active Query Selection for Crowd-Based Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:02:25.976213Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2508.19132"},"observation_digest":"sha256:b66a079c5d7eaf8980578dd398ab440a29a28b97a76460f4a080d79d566e5512","observation_id":"58fb53c3-1d03-4e44-9b60-4f6e10056144","resolution":{"observed_at":"2026-08-05T16:02:25.976213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-04T16:06:56.860428Z","title":"Pebble: Feedback-efficient interac- tive reinforcement learning via relabeling experience and unsupervised pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16136","last_updated":"2026-06-06T20:56:22Z","snapshot_observed_at":"2026-08-06T11:44:23.885368Z","submitted_at":"2025-09-19T16:35:27Z","title":"Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:56.860428Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2509.16136"},"observation_digest":"sha256:5dfcdcaa641e1b585c6cc026babdbbb44d97926ab64ca10988c922b8edd5dbeb","observation_id":"10b2cd0d-6808-4b23-a199-26ae8d81cedd","resolution":{"observed_at":"2026-08-04T16:06:56.860428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-07-12T22:33:25.723393Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00011","last_updated":"2026-04-12T09:09:23Z","snapshot_observed_at":"2026-08-03T12:14:19.091263Z","submitted_at":"2026-04-12T09:09:23Z","title":"RuleEdit: Failure-Guided Human-AI Model Editing with Prospective Impact Preview","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T22:33:25.723393Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2606.00011"},"observation_digest":"sha256:33c021e718afaac5e309a546167057e9c685fc40b223224cd1b01e847957062f","observation_id":"294511cf-d0ef-4e06-a517-4c9dee980e38","resolution":{"observed_at":"2026-07-12T22:33:25.723393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":"2106.05091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-07-04T19:40:06.257016Z","title":"PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":"bb93267b-0a0c-49b6-8a2e-00a9e4565cd1","year":2021},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-02T23:22:24.021209Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:7c3a12c8ab1a0080e0b7857e70eb54e13e71ca6d3eab03278f6277c9aa713377","observation_id":"7127ee49-baaf-4be9-99f8-d999492dfd71","resolution":{"observed_at":"2026-07-04T17:40:00.090762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":"2106.05091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-07-04T19:40:06.257016Z","title":"PEBBLE: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":"bb93267b-0a0c-49b6-8a2e-00a9e4565cd1","year":2021},"citing_paper":{"arxiv_id":"2606.25398","last_updated":"2026-06-24T04:52:04Z","snapshot_observed_at":"2026-08-06T04:56:00.009279Z","submitted_at":"2026-06-24T04:52:04Z","title":"MAPL: Multi-Objective Preference Learning for Robot Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T21:11:00.753949Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2606.25398"},"observation_digest":"sha256:040226726bdb1b6b190211b90fce12ae13dcf86f8e022b406ea54f626b095131","observation_id":"8544e529-e9bf-48bc-baa1-3c64508c4798","resolution":{"observed_at":"2026-07-04T19:40:06.258720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2106.05091/citation-record","integrity":"/paper/2106.05091/integrity","json":"/paper/2106.05091/citation-record.json","paper":"/paper/2106.05091"},"outbound":[],"paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2106.05091."}