{"as_of":"2026-08-17T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47ce79b18fc38b08634e0dcac9803256e88d7864d1be7f5075e561fb54714f6a","coverage":[{"denominator":230,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:15:15.675983Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:49:43.466155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:53:42.619268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11761","snapshot_observed_at":"2026-08-16T04:49:43.466155Z","title":"Mapping out the space of hu- man feedback for reinforcement learning: A conceptual framework, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00490","last_updated":"2025-05-01T12:45:09Z","snapshot_observed_at":"2026-08-16T17:38:53.847760Z","submitted_at":"2025-05-01T12:45:09Z","title":"Optimal Interactive Learning on the Job via Facility Location Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:49:43.466155Z"},"links":{"cited_paper":"/paper/2411.11761","citing_paper":"/paper/2505.00490"},"observation_digest":"sha256:b6a89baaa104c209cca1af53b1846723a11723c89df68950b1f3d6568f93b3f4","observation_id":"937736bc-582b-4837-9cce-bfb969b4967d","resolution":{"observed_at":"2026-08-16T04:49:43.466155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"cited_work":{"arxiv_id":"2411.11761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11761","snapshot_observed_at":"2026-08-07T13:53:42.619268Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","venue":"cs.LG","work_id":"7ce0b4fc-faf6-4876-8ef1-e9302fd85321","year":2024},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.462927Z"},"links":{"cited_paper":"/paper/2411.11761","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:69e582984f80d0b290dcb117ac8faf405ac99d360465fddccb9e029abb61c709","observation_id":"db71e279-304a-40eb-babd-6ef30e623a54","resolution":{"observed_at":"2026-08-07T13:53:42.823242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11761/citation-record","integrity":"/paper/2411.11761/integrity","json":"/paper/2411.11761/citation-record.json","paper":"/paper/2411.11761"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.258937Z","title":"Adadi and M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.258937Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:5a13f5d8a64c6e04ad67dd8955c5a60490d3b6912ffae946c7688e33b6643bcb","observation_id":"2d752c3b-4af4-4f00-b275-65f66a3e1032","resolution":{"observed_at":"2026-08-12T18:15:15.258937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.263763Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.263763Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:3fe6781b71ab9d666bbeb530fe13b49f72d1fb2c310c983a29ca001c40af0941","observation_id":"36d29749-6c96-4768-aa18-49df12a208c0","resolution":{"observed_at":"2026-08-12T18:15:15.263763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.268086Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.268086Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:196fec3b65de4e7ee6255b3165bd4b618207f3ff2497d16ff6dc2f9718b340c3","observation_id":"c744cfb5-98ee-4085-b2a7-0300021c3d4f","resolution":{"observed_at":"2026-08-12T18:15:15.268086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.275852Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.275852Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:c3ce9aa9a469588bad582528bb87c7be75f79a7728152f717bb588ea246dd874","observation_id":"db9a6119-f6a3-4d68-805c-3e3e11417fd2","resolution":{"observed_at":"2026-08-12T18:15:15.275852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.279608Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.279608Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ea6e5ac938bbc668b9124d9a91227c8e3e47c313796c2da6f2fc31cb9448e1e0","observation_id":"13bbccc6-de27-46bd-a91c-bbe019bf6ea7","resolution":{"observed_at":"2026-08-12T18:15:15.279608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.283943Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.283943Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:bb1bd484f472d6841ab0fcaac537e397c0b9fa469f7558005a6d65412c96cc3a","observation_id":"592dbe1c-b2fd-4899-9bc2-e8401a19f5ec","resolution":{"observed_at":"2026-08-12T18:15:15.283943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.287643Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.287643Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:6324f9e185a4ef8f74d5571e8589a1669aedfe9903bce3fa218da0e41f821142","observation_id":"740dc0cc-0548-4261-913b-0478e9da3000","resolution":{"observed_at":"2026-08-12T18:15:15.287643Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.291546Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.291546Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:0930c7019d8ad46fdcf5bc59b23d79b48c7b6cf1d909ce466134413720e1357d","observation_id":"b0a8958e-c780-4598-8055-c817b9e408e4","resolution":{"observed_at":"2026-08-12T18:15:15.291546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11748","last_updated":"2018-10-28T02:18:40Z","snapshot_observed_at":"2026-08-14T18:08:17.274832Z","submitted_at":"2018-10-28T02:18:40Z","title":"DQN-TAMER: Human-in-the-Loop Reinforcement Learning with Intractable Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.11748","snapshot_observed_at":"2026-08-12T18:15:15.295424Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.295424Z"},"links":{"cited_paper":"/paper/1810.11748","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:8a8a818e31a892df7d3d449dfe1e12d0ce2263bf40cb6c2c2c8f504f07539428","observation_id":"bd4a84aa-fd08-4199-8ee8-92b6c71ab8f7","resolution":{"observed_at":"2026-08-12T18:15:15.295424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.299331Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.299331Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:f9f7633521e646733c6e4f51ce561d41dea8fe4b3bfdcc94aed99d0bd6ffbc6e","observation_id":"905d39ff-fb8e-4b02-bcde-f5ec00f581b0","resolution":{"observed_at":"2026-08-12T18:15:15.299331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.302932Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.302932Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:90f38b002fc9606433ae5f91f8b4a4acf577345bca07178a2185dc879edf3bb6","observation_id":"db2cd15f-48d0-49fb-97d8-8bcf48878317","resolution":{"observed_at":"2026-08-12T18:15:15.302932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.306793Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.306793Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:9b8a8977ae648de96d86ee84013d4e57f99f5647da8fd2c9cc4c91681afc2db6","observation_id":"6de264a6-cda9-4a00-b558-30f3dc4f5026","resolution":{"observed_at":"2026-08-12T18:15:15.306793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.314980Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.314980Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:a9ea7fcf0a9e6c6f0c27b2f8b40385688e81af66ec923990de62861fdc85bd7f","observation_id":"23962868-4990-4e29-a0a0-a5cd9387bf58","resolution":{"observed_at":"2026-08-12T18:15:15.314980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.318816Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, and Jared Kaplan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.318816Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:6b892e7d1fc209710c9141c0d0d97a150d28eec8c093fa61ac074af723706b56","observation_id":"4ee6cdf7-7508-4c60-a157-e2c7becbdaf3","resolution":{"observed_at":"2026-08-12T18:15:15.318816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.327265Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.327265Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:f7b1b70e91235bca560673478b181b4018b3e4b4c891903416f6926e629371f3","observation_id":"34b61ad4-3b72-45ce-9f37-e448032c107b","resolution":{"observed_at":"2026-08-12T18:15:15.327265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T18:15:15.331348Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.331348Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:6bd615a8e2b4ce2405d7454e25dbac7b92dbba90023ed7e9af66308f7e14a97c","observation_id":"d440e91f-6329-49e5-b887-d28c43542209","resolution":{"observed_at":"2026-08-12T18:15:15.331348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.335705Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.335705Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:028d73f75c728358a0168ed91e54024379e25686a002fdf80b778a52063e71fa","observation_id":"2ba36619-3802-424d-8632-ecac70de1879","resolution":{"observed_at":"2026-08-12T18:15:15.335705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.344407Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.344407Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:fec4d787abc6a3eb585a74deffff501c7461bab0e0d040163577ed624fa89e93","observation_id":"d954d0a2-456f-40a9-b1e2-272a80e3d77c","resolution":{"observed_at":"2026-08-12T18:15:15.344407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.348418Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.348418Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:c5be2b076a7c0fbd8a2ee5ca824fddfc7d1848ed6bef5565f20a57a6cd89a5e1","observation_id":"5b6e0fa8-a1cd-4c28-8b38-54da9874cea9","resolution":{"observed_at":"2026-08-12T18:15:15.348418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.352225Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.352225Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:82d4d887005d391d43bb2bff2f0c8a4b1a2dfa010f86cd3a33b7842fde552db8","observation_id":"d126d785-1c3a-4ba3-a0e6-b4c3ae9b182c","resolution":{"observed_at":"2026-08-12T18:15:15.352225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.355976Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.355976Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:f44cb49a5200bb7da26a1cb8d5384baba939d9cc24637af0b2a33b40f3241e19","observation_id":"1da7c018-86e7-4336-9842-29615477044e","resolution":{"observed_at":"2026-08-12T18:15:15.355976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.359518Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.359518Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:b241b3a8da219253b708e684e4eed05af1fd41817512c596ccb08881edb6dd00","observation_id":"2c7e5665-774f-4c4f-8957-a796713b0364","resolution":{"observed_at":"2026-08-12T18:15:15.359518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.363125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.363125Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:b8e4876102fff90f5018d616651f0f92b2fcd9f37af7d645360e64b689809dbf","observation_id":"b0578416-43fc-48ff-88fe-f856c8ea42f3","resolution":{"observed_at":"2026-08-12T18:15:15.363125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.367687Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.367687Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:4b33ee85c42c0cb87f4162bcef782abfc761bb28a59144678e9c02148e12a80c","observation_id":"a948aefc-a329-4426-b398-7355029ecc9f","resolution":{"observed_at":"2026-08-12T18:15:15.367687Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.371612Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.371612Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:9accc72e975bd5f5761d472dc4d1b42ebcff07cd112e1f972faabaee482e63d6","observation_id":"6f5ea255-f732-408a-8c8c-ecbccda994d2","resolution":{"observed_at":"2026-08-12T18:15:15.371612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.375186Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.375186Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:765d7bc4cbc0a15db535116d79dabe9b051fb58b1a9c64c4c75d0a148fc65ff7","observation_id":"9a579aed-2e01-44ce-8dd0-61d706c1cd06","resolution":{"observed_at":"2026-08-12T18:15:15.375186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.379059Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.379059Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:210a5093dd1df4cd5fecc5c05eb91bac462f98c912c43cccbec71b1464f2f006","observation_id":"826a0476-31ee-495d-ae49-e9e4b5c7579d","resolution":{"observed_at":"2026-08-12T18:15:15.379059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.383373Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.383373Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:b4bd9b14ac18ef4937e5b52c1baec63905445d1cc7b9fdde0760644cd742ee1b","observation_id":"50d6eddd-fc39-4a80-9213-bfd7c86056f1","resolution":{"observed_at":"2026-08-12T18:15:15.383373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.386633Z","title":"Bradley Knox and Peter Stone","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.386633Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:362f7ddb14117ed587d803c935b894a305a42381e281e5f7212523bae8e65a43","observation_id":"2afc0f67-8c83-4a4e-b931-cd2bf5874f62","resolution":{"observed_at":"2026-08-12T18:15:15.386633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.390454Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.390454Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:b6ad50decbad392cc9a052336f0f5b4807646e2782d88f0375242abf59d24fe7","observation_id":"236b5316-fb2e-449d-a914-67a1bd83195e","resolution":{"observed_at":"2026-08-12T18:15:15.390454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.393863Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.393863Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:a676a252977ac49dbdcfb9172e25e8869b99349a39a381d654257e107d783275","observation_id":"38053e51-ec49-4493-94ba-34a653078492","resolution":{"observed_at":"2026-08-12T18:15:15.393863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06387","last_updated":"2019-07-09T03:51:47Z","snapshot_observed_at":"2026-08-14T16:47:14.974002Z","submitted_at":"2019-04-12T19:34:43Z","title":"Extrapolating Beyond Suboptimal Demonstrations via Inverse Reinforcement Learning from Observations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06387","snapshot_observed_at":"2026-08-12T18:15:15.397911Z","title":"Brown, Wonjoon Goo, Prabhat Nagarajan, and Scott Niekum","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.397911Z"},"links":{"cited_paper":"/paper/1904.06387","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:069485fd4cf7e935f6254a5c1864ab500e3dd282e544db38e358f2ba8b364d76","observation_id":"f16851a9-c73e-459c-afd7-1a2ec0fcc02e","resolution":{"observed_at":"2026-08-12T18:15:15.397911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.402559Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.402559Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:52f693f5b0d5690db3012ca9dc920f71db1b125bb94e931459df502938e3d644","observation_id":"8fab0c89-e996-4125-84e5-0f89efd1e21f","resolution":{"observed_at":"2026-08-12T18:15:15.402559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.artint.2014.08.005","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:16.318392Z","title":null,"venue":null,"work_id":"68f5c530-4f6d-47cd-8770-7812eb44f10c","year":2014},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.406732Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:9b674840509a3fe5aa8241ac3662a6ef5263ef937d8d52e2cd94eecd902c0aad","observation_id":"c505e5b3-85d8-46a6-84d1-fae0a2a3490e","resolution":{"observed_at":"2026-08-12T18:15:16.322649Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.411079Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.411079Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:94b415b3b3609459c9ace0deda56d563c19f3632198efa1f72c26c295784ef2b","observation_id":"b1b461c7-ccef-47fc-bdad-d4cc0172a7ed","resolution":{"observed_at":"2026-08-12T18:15:15.411079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-17T11:20:55.974248Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-12T18:15:15.416006Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.416006Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:21ae325973f0e16954bbaf913991f47c60ed02c848ced186001bf68977249f43","observation_id":"eae2e6d3-c826-4ff8-817a-b9fb153dc9c2","resolution":{"observed_at":"2026-08-12T18:15:15.416006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.420911Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.420911Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:bc59e3259e475724977954322271bda4da201eb88d0893c4f8499069c4450e90","observation_id":"e0ceac96-28be-4c9e-aa20-228beabe503b","resolution":{"observed_at":"2026-08-12T18:15:15.420911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.424902Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.424902Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ead7f5e5653bbc773a9b6124a335e0192317a9d2e725f928e22d00877de37481","observation_id":"fc4425e0-ea4f-42e5-886a-a1a963056c6f","resolution":{"observed_at":"2026-08-12T18:15:15.424902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-17T11:39:11.280205Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-12T18:15:15.428719Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.428719Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:84479ad363d23dc77d1e07475ae0ba673bec12a98737e6ca0f268a9becbbc15b","observation_id":"36d8aedb-c8ea-4ede-af28-61b8102dd00d","resolution":{"observed_at":"2026-08-12T18:15:15.428719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.433497Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.433497Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:197e7b227fecb56550c1d5d002add49155f9042060bf70f69b2b39cdc7f323f3","observation_id":"3d141350-6a57-4050-a175-d00bc0df049b","resolution":{"observed_at":"2026-08-12T18:15:15.433497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.436841Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.436841Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:551182e124279ddfa897160403f94a976d2ca8e9aba2a3fef46523bd48dc824c","observation_id":"403a22a5-17f6-408b-84e8-a315bd384959","resolution":{"observed_at":"2026-08-12T18:15:15.436841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.441619Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.441619Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:63344169737f7289da287ae580963b1960cbc4fbc5c3218f387be6f776bc4e72","observation_id":"22faeb14-3a0f-481a-b690-ff5ca53cfe7b","resolution":{"observed_at":"2026-08-12T18:15:15.441619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.02476","last_updated":"2023-06-29T04:40:18Z","snapshot_observed_at":"2026-07-06T09:53:05.195290Z","submitted_at":"2020-09-05T06:32:38Z","title":"Using Machine Teaching to Investigate Human Assumptions when Teaching Reinforcement Learners","version":4},"cited_work":{"arxiv_id":"2009.02476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.02476","snapshot_observed_at":"2026-08-12T18:15:17.499051Z","title":"Using Machine Teaching to Investigate Human Assumptions when Teaching Reinforcement Learners","venue":"cs.LG","work_id":"f3c7bb60-fdb3-42b0-a2c6-60db5bfaad43","year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.446029Z"},"links":{"cited_paper":"/paper/2009.02476","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:b59ad1434a9fc0cd7ccc3664d479cd17346e99de9ecc41ebd2c360f237bb07f7","observation_id":"b42517da-a5a0-497a-b10e-35326d6dcb3c","resolution":{"observed_at":"2026-08-12T18:15:17.503411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.449995Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.449995Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:bdcc0e94b353aee3f5fe43195438d3b5330f2e94620a20cb613897e31b2011fa","observation_id":"c456124d-b35c-426d-b99d-18971ec5dd30","resolution":{"observed_at":"2026-08-12T18:15:15.449995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.453645Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.453645Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:4c33b31b07872067f61b6ea836e90a5422d015e311d1218d5382785b3eaac437","observation_id":"c887c3fd-fdad-4d88-89a9-185e1cbb5972","resolution":{"observed_at":"2026-08-12T18:15:15.453645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05187","last_updated":"2022-10-11T06:46:27Z","snapshot_observed_at":"2026-08-16T16:25:17.712058Z","submitted_at":"2022-10-11T06:46:27Z","title":"Broad-persistent Advice for Interactive Reinforcement Learning Scenarios","version":1},"cited_work":{"arxiv_id":"2210.05187","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.05187","snapshot_observed_at":"2026-08-12T18:15:17.482405Z","title":"Broad-persistent Advice for Interactive Reinforcement Learning Scenarios","venue":"cs.AI","work_id":"a2247271-f689-4dd4-9d1a-06e66aca32f9","year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.457040Z"},"links":{"cited_paper":"/paper/2210.05187","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:91de83bb37a222a518327ea0dd1ce179ca6a983ec08277edeee50bde5e9ff63a","observation_id":"b53fb3c5-d9df-4863-bdca-79e6bbd58194","resolution":{"observed_at":"2026-08-12T18:15:17.486576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.84892","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:17.463819Z","title":"Parisi, and Stefan Wermter","venue":null,"work_id":"588b5f68-b3b5-4e9e-a30a-9488dae120c1","year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.461751Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ac3d2d58f750e5561354faba5eccd3812654092e6291d5a4c4568012b112b969","observation_id":"cb0eaad1-5adf-47c4-8876-9fc4e8912278","resolution":{"observed_at":"2026-08-12T18:15:17.469255Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.465277Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.465277Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:b4ab9c0809d6630271e25a1e450d2051709e322133bdbeabd3ae86efce4e0aa8","observation_id":"1d1779e8-eb2d-4665-bd6f-8df5c2d5211f","resolution":{"observed_at":"2026-08-12T18:15:15.465277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.469194Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.469194Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:42fba39333757dcb0868394cadf9b3d3c3b0c567032cce0931a555d02f0def2a","observation_id":"f17038cd-ed4c-4876-9a2b-b22c339cad24","resolution":{"observed_at":"2026-08-12T18:15:15.469194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.473608Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.473608Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:d72546a247f2e1e2254058357a42d141ed77cee25ea98bc651f316482c99b46a","observation_id":"72ac4b67-0907-4a47-a959-ed8a1279871c","resolution":{"observed_at":"2026-08-12T18:15:15.473608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.478148Z","title":"Deshpande, Jeff Schneider, Deepak Pathak, David Held, and Benjamin Eysenbach","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.478148Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:231695df057c49c1d7aec5a297581e740d5ad2387ad7e72b53c7deb0c1d8765d","observation_id":"31423784-e544-4742-9dfe-40caa8ebe970","resolution":{"observed_at":"2026-08-12T18:15:15.478148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06778","last_updated":"2016-05-27T19:25:59Z","snapshot_observed_at":"2026-08-14T22:00:28.306146Z","submitted_at":"2016-04-22T18:57:24Z","title":"Benchmarking Deep Reinforcement Learning for Continuous Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06778","snapshot_observed_at":"2026-08-12T18:15:15.481768Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.481768Z"},"links":{"cited_paper":"/paper/1604.06778","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:466b447f0254cc2fbe2890966c83e70f01291487d219c546e4effe78add8bae7","observation_id":"e2217a00-6830-49ef-814b-375063034c84","resolution":{"observed_at":"2026-08-12T18:15:15.481768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.486352Z","title":"Dudley and Per Ola Kristensson","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.486352Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ccf420d2b0644cc5e123480e84c9e053b4c8c02f0ee5f239d05486fbe5d83bcc","observation_id":"9d9ec737-a588-4e2e-ac96-60b613aae526","resolution":{"observed_at":"2026-08-12T18:15:15.486352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.490173Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.490173Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:7dea9eaaa6bd01cc2fd831dd3dceb495c8817c3226982b71c4b1da5c3db6bc85","observation_id":"6d5600ad-4b30-412f-a14f-581376d3b9fc","resolution":{"observed_at":"2026-08-12T18:15:15.490173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.494567Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.494567Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ec23a0a65822ecabd806c72e4b08e5e80cd71c73c2d0cbea3270c7d9707c61c4","observation_id":"85207a17-bd72-48cc-b808-c428b44ff3e5","resolution":{"observed_at":"2026-08-12T18:15:15.494567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.498105Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.498105Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:4945b71549d9e650ce0cfd87dadce35550714d8b7b42b899938f5cf89ef1548a","observation_id":"abcd76fe-1937-40db-a8b3-61d5df8d7be8","resolution":{"observed_at":"2026-08-12T18:15:15.498105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.501801Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.501801Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:a8a45e65246de2770e6ad012e865fab610bb33e3e54679e23923bd2553a5aee3","observation_id":"df9c4a6b-c8da-4d27-8d25-5fb8a43da6a2","resolution":{"observed_at":"2026-08-12T18:15:15.501801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.505497Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.505497Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:93067074b4cccb14579f2c40898c5a77229f689f056495dd0aff8e8d8ec31900","observation_id":"a87e0388-aac1-4f74-b659-7003fdfbe71a","resolution":{"observed_at":"2026-08-12T18:15:15.505497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.509926Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.509926Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:12b11fc66b14b386e34e159c9709014b06167033846e95e6ed1997b68f6bf189","observation_id":"d7e3483d-58e5-4aaa-84c3-91182185e39d","resolution":{"observed_at":"2026-08-12T18:15:15.509926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.514327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.514327Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:cd3329b67d3a6849f4a618140227d71d345388e61ad8d43a4c39bebbfe99b103","observation_id":"18b47739-c21b-483a-ae57-d74a7efa4201","resolution":{"observed_at":"2026-08-12T18:15:15.514327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.518319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.518319Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:090462c0ce6445ad7c5cb7537f62dc6b7c02bda302e522fca14f9d8c1458e326","observation_id":"f7504670-a013-4801-bd64-273da66cc7bc","resolution":{"observed_at":"2026-08-12T18:15:15.518319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.522257Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.522257Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:2bd64393c204811cdf6b5fedafc79594b0eeb5696d363608425f750706b56b50","observation_id":"399551cb-0ddf-42a6-8e8f-9c8e372ddfbb","resolution":{"observed_at":"2026-08-12T18:15:15.522257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.527057Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.527057Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:8571b3ff96ad2aa48571f52d9945e9e47226792a90ed42537a0f3df6b2a1a98c","observation_id":"90955e1d-f4a5-48ea-8ae2-565d661e9c7d","resolution":{"observed_at":"2026-08-12T18:15:15.527057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.530756Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.530756Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:10a494eae1c98405d65493a5d6c911d98a7961aa819aa7279445c388c1f15232","observation_id":"98fa9339-e45f-4463-8968-61c5f1eca636","resolution":{"observed_at":"2026-08-12T18:15:15.530756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07691","last_updated":"2021-01-19T15:35:30Z","snapshot_observed_at":"2026-08-16T18:51:21.995349Z","submitted_at":"2021-01-19T15:35:30Z","title":"Choice Set Misspecification in Reward Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.07691","snapshot_observed_at":"2026-08-12T18:15:15.535401Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.535401Z"},"links":{"cited_paper":"/paper/2101.07691","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:efa44764631831a06ed52b49a24940cf4d339ef761e64ab82877e6aab033ba31","observation_id":"38280829-3121-4a14-a401-71c4d8deb72f","resolution":{"observed_at":"2026-08-12T18:15:15.535401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-12T18:15:15.539134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.539134Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:91a786872532e79ac937e7f6332d52a1b2fd96b2adfddfb24a90c4f137aaf2df","observation_id":"a70f7910-1e70-47dd-8257-e3949cae8dc5","resolution":{"observed_at":"2026-08-12T18:15:15.539134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09658","last_updated":"2018-08-29T06:49:49Z","snapshot_observed_at":"2026-08-17T21:03:26.871887Z","submitted_at":"2018-08-29T06:49:49Z","title":"APRIL: Interactively Learning to Summarise by Combining Active Preference Learning and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1808.09658","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.09658","snapshot_observed_at":"2026-08-12T18:15:17.307720Z","title":"APRIL: Interactively Learning to Summarise by Combining Active Preference Learning and Reinforcement Learning","venue":"cs.CL","work_id":"78ca57cc-8df3-48f4-b263-464c5345fdf9","year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.543119Z"},"links":{"cited_paper":"/paper/1808.09658","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:691e52c2dca88f0c3fd08866ba12b52355f19ec9a8bea5f8fc858540cc4cc4db","observation_id":"cc0915c8-e1e2-4b7e-9f29-311906a8b431","resolution":{"observed_at":"2026-08-12T18:15:17.312037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10687","last_updated":"2023-03-09T15:43:15Z","snapshot_observed_at":"2026-08-16T16:37:33.008012Z","submitted_at":"2022-08-23T02:19:10Z","title":"The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types","version":2},"cited_work":{"arxiv_id":"2208.10687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.10687","snapshot_observed_at":"2026-08-12T18:15:17.290436Z","title":"The Effect of Modeling Human Rationality Level on Learning Rewards from Multiple Feedback Types","venue":"cs.LG","work_id":"29652cf5-082d-4aa7-b79b-4e0513dd7499","year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.547368Z"},"links":{"cited_paper":"/paper/2208.10687","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:2eb2db39de33a1d17e17d03146b336b6a91942ff92dfd834900ef246a2469506","observation_id":"959001cf-1533-4d5b-81cb-164c9a358211","resolution":{"observed_at":"2026-08-12T18:15:17.294535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.551329Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.551329Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:9ebde9b18672299f9ebbd2f50f572b14a96cec05974a0da00adb7c3b1a0b5e81","observation_id":"677e93f4-aab2-4329-8f45-c761e71cee31","resolution":{"observed_at":"2026-08-12T18:15:15.551329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.554896Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.554896Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:4e03d7da48717bbf3d2f4dd9e73c59a1bbf472f01037c45a50d0511a0439b211","observation_id":"086b3363-fa59-4a44-abf8-e6665cba8458","resolution":{"observed_at":"2026-08-12T18:15:15.554896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.558855Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.558855Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ffb0a1bfd3a79023a3f84022181efe26387b5a98ceadd0dfe6764833afd45b37","observation_id":"1b2779a1-80aa-44b3-b3bc-48e8fc79b287","resolution":{"observed_at":"2026-08-12T18:15:15.558855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.562881Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.562881Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:c41e3646451dd1e4d90be5328030cf9170d71f91b1c043a8a5467c6a7b266b94","observation_id":"8c87efd5-9bc6-4862-932e-96c7caca7973","resolution":{"observed_at":"2026-08-12T18:15:15.562881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.566355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.566355Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:7569906a81a648299c2c0b20d00dc9cf1b1015522936ff3da98a8977516799ee","observation_id":"781e3788-4e30-41c1-8c23-7a1904671e42","resolution":{"observed_at":"2026-08-12T18:15:15.566355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08616","last_updated":"2017-09-14T02:06:26Z","snapshot_observed_at":"2026-08-14T20:45:03.641534Z","submitted_at":"2017-07-26T19:23:54Z","title":"Guiding Reinforcement Learning Exploration Using Natural Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08616","snapshot_observed_at":"2026-08-12T18:15:15.569994Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.569994Z"},"links":{"cited_paper":"/paper/1707.08616","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:33def408f505f0063ea6f8889ecaaf82a326ce4ca4b888e97bd0510ec665aa47","observation_id":"52f8ca4b-b864-46a9-b15e-274c6c1c986c","resolution":{"observed_at":"2026-08-12T18:15:15.569994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.574353Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.574353Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:f8494f3e741220641fe2583eb76d14bbe5854b46902731ef929119f0530e1a96","observation_id":"9f3ca8fb-a359-4e0b-9dd7-bdfc903f89d7","resolution":{"observed_at":"2026-08-12T18:15:15.574353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.577947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.577947Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:d92c3634e397ef1589fafed543918646633934058e820730f11ae718bd657de3","observation_id":"7f4a70ad-7565-4ce6-b5dc-148ef4ca7484","resolution":{"observed_at":"2026-08-12T18:15:15.577947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.581791Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.581791Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:0b5dccf941434dfb6df6bcfd614134e31e99f2959e120ea0dca5b42365696ac7","observation_id":"ecd917d6-12ad-4e78-81fe-f54b023edd09","resolution":{"observed_at":"2026-08-12T18:15:15.581791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.586469Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.586469Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:f83d4b5dd4cfe56afcdc82d08bb418e38d7ad3062d46569b72146f064de9a58a","observation_id":"90414646-2e10-4404-9d7b-fefd054b81ce","resolution":{"observed_at":"2026-08-12T18:15:15.586469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.589936Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.589936Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:961a4c2e0c4d805c39efde71663b3c2f34d71dd6b9d70839be8f0421ba0bc9d2","observation_id":"10cda54b-8be0-47d6-b408-5fe6c27217d4","resolution":{"observed_at":"2026-08-12T18:15:15.589936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04833","last_updated":"2020-12-11T17:56:03Z","snapshot_observed_at":"2026-08-17T12:33:33.258247Z","submitted_at":"2020-02-12T08:07:49Z","title":"Reward-rational (implicit) choice: A unifying formalism for reward learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04833","snapshot_observed_at":"2026-08-12T18:15:15.593768Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.593768Z"},"links":{"cited_paper":"/paper/2002.04833","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:da7ecbfb64350ec02593957cf49e07dc2a1da09f0099cb77a0e8a7cb77736283","observation_id":"460235c7-d02d-4c01-b567-90d8451b4c7d","resolution":{"observed_at":"2026-08-12T18:15:15.593768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09401","last_updated":"2025-02-11T18:18:59Z","snapshot_observed_at":"2026-08-17T03:04:22.544692Z","submitted_at":"2024-02-14T18:58:40Z","title":"Reinforcement Learning from Human Feedback with Active Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09401","snapshot_observed_at":"2026-08-12T18:15:15.598159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.598159Z"},"links":{"cited_paper":"/paper/2402.09401","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:ea3631a461091c87e1ed663e9e2d797813e0729f0cbe399fa91e9776658f4edd","observation_id":"7036c7d0-9413-47a1-95c5-49fd2b504709","resolution":{"observed_at":"2026-08-12T18:15:15.598159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.602141Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.602141Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:fc24c5409988b8c6fe8bb9dbe9147142a4ecd1367d58de127849c8fc703b1f99","observation_id":"bbbd3ca6-8544-4c93-b4ed-cad2e0daad4c","resolution":{"observed_at":"2026-08-12T18:15:15.602141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02627","last_updated":"2020-05-06T17:59:11Z","snapshot_observed_at":"2026-08-14T18:31:29.260572Z","submitted_at":"2018-09-07T18:13:25Z","title":"Unity: A General Platform for Intelligent Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02627","snapshot_observed_at":"2026-08-12T18:15:15.606433Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.606433Z"},"links":{"cited_paper":"/paper/1809.02627","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:650644e9f5a4a5b7d78c1d848393d08429836c41b0f13b470f033b194731c840","observation_id":"c77ae9f2-60dc-44f9-95fb-6ab9316319b7","resolution":{"observed_at":"2026-08-12T18:15:15.606433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.610358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.610358Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:77fd9e0086bf240f0c1fa0b61722a00fac3013a0188eb4021841dc0535907605","observation_id":"9152dc1f-8198-42a5-9725-5b3d25deedf7","resolution":{"observed_at":"2026-08-12T18:15:15.610358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.614077Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.614077Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:79a0bb693f83dbdea8a150e4a11eaa4cf060d6766b93ee5728db880b026f5c4f","observation_id":"1a5e3a24-1f6b-4ee2-b526-ce70f5d5aaf8","resolution":{"observed_at":"2026-08-12T18:15:15.614077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.617960Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.617960Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:21106a0963044a72372dd67092cc5f013eb9473eeb88c9c7f5d6c17e59729dd2","observation_id":"b6a5b2ad-a0f3-4074-93b2-4f77659522f6","resolution":{"observed_at":"2026-08-12T18:15:15.617960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.621309Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.621309Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:8f5d7b656af1de36aa2aef735e7e80c81e0633d9c6157c349bf9b28771743f64","observation_id":"7d0c4ba9-5f89-41fc-baa0-0917ca0df6a3","resolution":{"observed_at":"2026-08-12T18:15:15.621309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.624743Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.624743Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:58e64f857ab5f7e71d7d06c779db7f3744647adb8d9c33afed4743fda6fa88f4","observation_id":"28a8f9d2-ef66-4feb-b706-0b4a43bd62b4","resolution":{"observed_at":"2026-08-12T18:15:15.624743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.629155Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.629155Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:12e0f3f34b0f4141bc29065bd4bbfb014e61f726d0c6cbf896c1540c0f8f8c2f","observation_id":"97b6bf3a-2340-4d28-8df5-5af889e7d89d","resolution":{"observed_at":"2026-08-12T18:15:15.629155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.633116Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.633116Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:aed637abd3b70dd59c3cd67075ef14ca7b5bb7f1a8f62376edfe0f35573de035","observation_id":"56ca0346-2d9e-44f8-8d5b-9cb8d1ca6412","resolution":{"observed_at":"2026-08-12T18:15:15.633116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.636948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.636948Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:f20195eb65ce62733e5b1449956cbe5b3a711c1c760f3fb64db49ea86d4a6843","observation_id":"6c0d7e9b-c666-43c8-871a-20cae22bde0b","resolution":{"observed_at":"2026-08-12T18:15:15.636948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.640997Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.640997Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:3379432016006af01ccdf7d3c796c75b26f32825a6e8f4842a46371f9a182d57","observation_id":"ff8c5cf9-8561-4054-95f8-db97ca544c7e","resolution":{"observed_at":"2026-08-12T18:15:15.640997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.05821","last_updated":"2018-04-16T17:45:32Z","snapshot_observed_at":"2026-08-14T19:25:27.425303Z","submitted_at":"2018-04-16T17:45:32Z","title":"Newtonian Action Advice: Integrating Human Verbal Instruction with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1804.05821","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.05821","snapshot_observed_at":"2026-08-12T18:15:17.166746Z","title":"Newtonian Action Advice: Integrating Human Verbal Instruction with Reinforcement Learning","venue":"cs.HC","work_id":"a933edd4-c05a-4363-b15f-f5851fd19d08","year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.644741Z"},"links":{"cited_paper":"/paper/1804.05821","citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:e1efade0c5da8974cf94667c70650d876d3998a55e57e81266b3c3d59f9678f5","observation_id":"25ddf0f6-d3a3-489a-8adb-d24ef185bf13","resolution":{"observed_at":"2026-08-12T18:15:17.170546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.648600Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.648600Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:70f2a1d459d17fba012c5de9c57826576966c3737d9d464a8c0d2f8de5d8496b","observation_id":"1edb2320-9c7f-4296-bd4a-f986f6cb4c0d","resolution":{"observed_at":"2026-08-12T18:15:15.648600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.652311Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.652311Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:bfa28d34d7defb9d19101aebcd7e165a5caae60ab89aa75524d44bd11dcb964f","observation_id":"a7d13dff-6008-4b40-855c-20eeff157093","resolution":{"observed_at":"2026-08-12T18:15:15.652311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.655707Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.655707Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:7b0112d936d51937682ccc377ad40a519c050d8aae84e867d3795501448fa1b3","observation_id":"916bad6c-62a5-49af-b8f6-f6b48381e6ad","resolution":{"observed_at":"2026-08-12T18:15:15.655707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.659541Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.659541Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:74104917b51ab718400a0dc95458352c4f202594d1454d7836a09f2950600ba8","observation_id":"6e8e549f-d12f-4466-81fd-0e72a7c171b3","resolution":{"observed_at":"2026-08-12T18:15:15.659541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.668131Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.668131Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:1e0d3424eeec79a7e1f9106ac71c099439c7fd14f2b2933c8814adc581acf30c","observation_id":"c0434bbf-afd9-46d1-bab9-797afd16f6fe","resolution":{"observed_at":"2026-08-12T18:15:15.668131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.671740Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.671740Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:bbb5f9a9ca532687d64e0b2bf73bfcd76a179e9d38748dfa20a4e6b7eacbb0d6","observation_id":"b4e6b976-6b24-49e4-9c2e-bc8d9b8dfa3c","resolution":{"observed_at":"2026-08-12T18:15:15.671740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:15:15.675983Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T18:15:15.675983Z"},"links":{"citing_paper":"/paper/2411.11761"},"observation_digest":"sha256:07e02dccde572ee59eda236321117ce6f027275469ab6e096fd6290c73557144","observation_id":"63f0c3ea-8a03-49e1-a3b7-d3c65a034cf5","resolution":{"observed_at":"2026-08-12T18:15:15.675983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11761","last_updated":"2025-02-20T16:22:19Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T08:34:22.985905Z","submitted_at":"2024-11-18T17:40:42Z","title":"Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":91,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":230},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 230 outbound references and 2 inbound Pith citation observations for arXiv:2411.11761."}