{"as_of":"2026-08-20T14:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:651013705aaac3bf128581909b5c6ac2b3a46f79b337327ddc704abf5f3a2b82","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:33:04.401624Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13741/citation-record","integrity":"/paper/2506.13741/integrity","json":"/paper/2506.13741/citation-record.json","paper":"/paper/2506.13741"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2008.12340","last_updated":"2020-08-27T19:08:30Z","snapshot_observed_at":"2026-08-15T05:49:00.597502Z","submitted_at":"2020-08-27T19:08:30Z","title":"Forecasting with Multiple Seasonality","version":1},"cited_work":{"arxiv_id":"2008.12340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.12340","snapshot_observed_at":"2026-08-07T00:33:04.539654Z","title":"Forecasting with Multiple Seasonality","venue":"cs.LG","work_id":"304e563b-60bc-4d95-b92a-0903c68ef109","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.096688Z"},"links":{"cited_paper":"/paper/2008.12340","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:2575e380886e1e2517489be467743fc76d5d00a0524fc2986b9450608191f277","observation_id":"0d3ca3b8-39bc-4df9-9bda-4faae0bb9f96","resolution":{"observed_at":"2026-08-07T00:33:04.542813Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.766595Z","title":"Batch active preference-based learning of reward functions","venue":null,"work_id":"230e0cbb-7054-4100-a813-c01738c88842","year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.165524Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:bcdd1f93bdefd3bfdf513583856bf678e2bd1af5ec52eec2f0028052f3cc3e1c","observation_id":"0ff5fe61-f701-4d0e-98cf-f78aa95601dc","resolution":{"observed_at":"2026-08-07T00:33:04.769359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.757928Z","title":"Landolfi, Dylan P","venue":null,"work_id":"ed667b85-9e6f-4723-9b17-ba569645c3a2","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.194615Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:7f2fd83da15def2afb480543b9f107a6f6b7dbc929d7729ea8f6b73fc1425228","observation_id":"3ca188d0-d1aa-4191-bee9-ae299a861ddf","resolution":{"observed_at":"2026-08-07T00:33:04.761093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:02.271354Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.271354Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:d037043375e187ac1b5a43ff95cb5dbbab7b537732cb51901eac775804a8da4b","observation_id":"16f14e3a-6d11-45d0-a1a3-9dbcc885d1ff","resolution":{"observed_at":"2026-08-07T00:33:02.271354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.744218Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"bcf02ed6-2226-4cb7-8b14-98d1c2605421","year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.342628Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:c38936d324b5742bdb5791e11905efd173afb39549695c71ab30924b7a31d4ec","observation_id":"bb8ca152-c1ee-466f-8552-22153d40bb14","resolution":{"observed_at":"2026-08-07T00:33:04.747117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.735539Z","title":"Autonomous skill discovery with quality-diversity and unsupervised descriptors","venue":null,"work_id":"f444b290-c455-4151-b511-076d04b58624","year":2019},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.370760Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:6fa8adc467a6048530ac2991c2a60b20ceb627ab013f5f7db85a03317c0f5e6c","observation_id":"75ee63ad-1625-4f68-87ca-0306261e0258","resolution":{"observed_at":"2026-08-07T00:33:04.738394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13800","last_updated":"2021-09-28T15:30:55Z","snapshot_observed_at":"2026-08-20T09:05:22.495454Z","submitted_at":"2021-09-28T15:30:55Z","title":"Faster Improvement Rate Population Based Training","version":1},"cited_work":{"arxiv_id":"2109.13800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13800","snapshot_observed_at":"2026-08-07T00:33:04.525904Z","title":"Faster Improvement Rate Population Based Training","venue":"cs.NE","work_id":"e27cad6b-acd6-4da7-bdae-2fb0d8aad262","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.441449Z"},"links":{"cited_paper":"/paper/2109.13800","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:ad15dc8984c406dc396200fbce2af2ac43e7ce9cf9c0964ecf24342e68d25f92","observation_id":"ee5644ab-4798-4701-ab72-26e93eb93764","resolution":{"observed_at":"2026-08-07T00:33:04.530615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.727222Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"d5960e3f-617c-4e1b-81e7-039d98988ff9","year":2019},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.502883Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:fc9de8716c86bc2799e3c99aa2df1091d0f082345a8e420b31536f806995ad61","observation_id":"98854a81-2221-4aef-b8d9-d1f072050231","resolution":{"observed_at":"2026-08-07T00:33:04.730037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.718553Z","title":"Jax-lob: A gpu-accelerated limit order book simulator to unlock large scale reinforcement learning for trading","venue":null,"work_id":"a9c6cb20-defc-4ecf-b1a5-91ea76029705","year":2023},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.566117Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:1d863e5dc896623f9d6c50eb93d71c490082f91f110fcb92458031bd906475ab","observation_id":"8b8647fa-d609-449b-9991-3b6ff6253b6e","resolution":{"observed_at":"2026-08-07T00:33:04.721729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:02.622234Z","title":"u rnkranz, Eyke H \\","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.622234Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:b1301cc0b57c08506f9e546f28e5aba68a7e1e2049c29eb0c7ac2b1223d16139","observation_id":"7018460c-2e08-436c-9e75-6936fccb3a54","resolution":{"observed_at":"2026-08-07T00:33:02.622234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T00:33:02.685817Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.685817Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:356105e45cf5481bc13ce2b1abd39acb779235f8eea5fbd727540b0c82ab23dc","observation_id":"845db6e5-ee25-43ac-98cb-4ebbacc3c51d","resolution":{"observed_at":"2026-08-07T00:33:02.685817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.705116Z","title":"Russell, and Anca D","venue":null,"work_id":"28d4d7ea-7396-45d9-b1f3-ae23b1f77f74","year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.753777Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:e87d1d94d4371fd4f54fb8c1a2d96d75b09e5114e062a5ee915852bc2efb636d","observation_id":"20f8516b-548f-49ce-b3b0-246b310d433a","resolution":{"observed_at":"2026-08-07T00:33:04.707679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.695164Z","title":"Query-policy misalignment in preference-based reinforcement learning","venue":null,"work_id":"4a800fd3-3991-4738-99d7-ed8b49a4d4f3","year":2024},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.789081Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:ce4b15279ae3e2f35c0304f7862ac7713723d163b265cde2260dde5ca7372775","observation_id":"2dc743d1-2a3b-46ca-9edf-4d6bdf6d34c9","resolution":{"observed_at":"2026-08-07T00:33:04.698293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06079","last_updated":"2025-05-09T14:22:43Z","snapshot_observed_at":"2026-08-19T23:04:35.722733Z","submitted_at":"2025-05-09T14:22:43Z","title":"TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06079","snapshot_observed_at":"2026-08-07T00:33:02.820968Z","title":"Trend: Tri-teaching for robust preference-based reinforcement learning with demonstrations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.820968Z"},"links":{"cited_paper":"/paper/2505.06079","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:f79ad827093beb05afbee8a8f2ea1b3ec6b3297635c813e90c4d46a369bfe08a","observation_id":"b34a91bc-ede1-4ca6-9fce-25bd053e69b7","resolution":{"observed_at":"2026-08-07T00:33:02.820968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09846","last_updated":"2017-11-28T16:16:21Z","snapshot_observed_at":"2026-08-15T05:47:29.683783Z","submitted_at":"2017-11-27T17:33:27Z","title":"Population Based Training of Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09846","snapshot_observed_at":"2026-08-07T00:33:02.870174Z","title":"Czarnecki, Jeff Donahue, Ali Razavi, Oriol Vinyals, Tim Green, Iain Dunning, Karen Simonyan, Chrisantha Fernando, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.870174Z"},"links":{"cited_paper":"/paper/1711.09846","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:478f912dc37c0689df464e6d6b7bc642146377dff24ec906767e321fa89cee7c","observation_id":"fc53ef44-60ad-4df3-ad40-b688b6a136cd","resolution":{"observed_at":"2026-08-07T00:33:02.870174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.687037Z","title":"One solution is not all you need: Few-shot extrapolation via structured maxent rl","venue":null,"work_id":"260d8b5d-9691-4350-8378-61961b1fd4ff","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.922990Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:8870a341e4c5dd2ae32f0f9ca4385a78177d13c7f0fbb858edbac18576b098eb","observation_id":"4a483ab6-d007-40f8-8f9b-c6b3a0bf95af","resolution":{"observed_at":"2026-08-07T00:33:04.689812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.679446Z","title":"B-pref: Benchmarking preference-based reinforcement learning","venue":null,"work_id":"0e69fb24-b1e6-482a-b9f7-62e7d9d21c79","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.965011Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:65010bf014798381f045afba811365109cdb197f822e2bc7018eb67646ef1a90","observation_id":"b0a333ab-5437-4079-b7de-e88058b5fd29","resolution":{"observed_at":"2026-08-07T00:33:04.682059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.671714Z","title":"Smith, and Pieter Abbeel","venue":null,"work_id":"a961c52b-0730-45ff-8def-71f2f4476fd2","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.009880Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:04feb9fe22038a1474c75892effd82b7c9f54c772e3bd3e6adecbdea489c4f15","observation_id":"dea18995-5bd0-4844-b2e9-15ef7185ed2b","resolution":{"observed_at":"2026-08-07T00:33:04.674287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.664341Z","title":"Evolution through the search for novelty","venue":null,"work_id":"3283b821-ca97-495a-9c0b-4ace1bccf58f","year":2012},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.076339Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:6526117b0f1a52fc28812fcaee6a59eb19db4269ab0b054c89c4f839c642ee9a","observation_id":"22081c72-68ed-4432-befd-c43cfb4912b9","resolution":{"observed_at":"2026-08-07T00:33:04.666897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.656455Z","title":"Evolving a diversity of virtual creatures through novelty search and local competition","venue":null,"work_id":"fb32d908-9ccf-4351-95ee-628f04763e41","year":2011},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.161033Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:c48b301bb97fed7726e9ffae9f1cab75c1dc98f4204f1c387730610b18467d2e","observation_id":"7394ec4d-2201-40c3-adc0-e427cf205823","resolution":{"observed_at":"2026-08-07T00:33:04.659279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.648216Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":"5f376495-92f3-4e57-9bf1-8599ca20fa36","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.215678Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:92a8b5db2250de26808447b090df7e7e08ed523026f0c5f008ed00cb101c247d","observation_id":"8f765897-1cd7-4aa4-b3e0-3abdf2ead841","resolution":{"observed_at":"2026-08-07T00:33:04.651000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.640097Z","title":"Meta-reward-net: Implicitly differentiable reward learning for preference-based reinforcement learning","venue":null,"work_id":"09573bac-4c50-43cd-bdb3-5db357d58ef2","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.280078Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:9ec3160d978bcf426b7c1be6499719b0033e6adcc52bf13150b929fb2ad36e4a","observation_id":"d7e0be92-746a-4f3c-b441-eb77449568ab","resolution":{"observed_at":"2026-08-07T00:33:04.643003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.631878Z","title":"Efficient preference-based reinforcement learning using learned dynamics models","venue":null,"work_id":"9dc2e7e7-ce18-4740-8f42-d94c557d0807","year":2023},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.339377Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:efc6a5fb461edda6fa618a9665c08911feda57ba729b00a1fec65f80359a2aaf","observation_id":"8b9e4ef6-97bd-43a6-9945-99b25d8274ca","resolution":{"observed_at":"2026-08-07T00:33:04.634836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.623914Z","title":"Variquery: Vae segment-based active learning for query selection in preference-based reinforcement learning","venue":null,"work_id":"a4879930-f166-47e0-9764-604d0458ea6a","year":2023},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.389931Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:2c4f75e4d0ebc218a95ccc138cc580f7bce60a9a68c5c5484a7f1f2f4fa132be","observation_id":"6856a5f5-707d-44d1-863e-9b9c6e4b3f86","resolution":{"observed_at":"2026-08-07T00:33:04.626755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06527","last_updated":"2022-11-12T00:34:41Z","snapshot_observed_at":"2026-08-20T07:47:59.928413Z","submitted_at":"2022-11-12T00:34:41Z","title":"Rewards Encoding Environment Dynamics Improves Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06527","snapshot_observed_at":"2026-08-07T00:33:03.458839Z","title":"Rewards encoding environment dynamics improves preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.458839Z"},"links":{"cited_paper":"/paper/2211.06527","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:7687b194a55170652f6f1bde7cbd2b1f3a62f0cec6ddc58b93efbafe7c74ca95","observation_id":"5e0af0b1-3115-40a0-80bb-045cb1e8d4b5","resolution":{"observed_at":"2026-08-07T00:33:03.458839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.04909","last_updated":"2015-04-20T01:17:00Z","snapshot_observed_at":"2026-08-15T13:07:45.856087Z","submitted_at":"2015-04-20T01:17:00Z","title":"Illuminating search spaces by mapping elites","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.04909","snapshot_observed_at":"2026-08-07T00:33:03.520942Z","title":"Illuminating search spaces by mapping elites","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.520942Z"},"links":{"cited_paper":"/paper/1504.04909","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:338b0e953977a4faeb1a17139a85ac319bf8b5a8b80285fdfb0a18847ae534f7","observation_id":"10ecdd6d-fdf7-4749-a094-8816e6e2010b","resolution":{"observed_at":"2026-08-07T00:33:03.520942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.614765Z","title":"Xland-minigrid: Scalable meta-reinforcement learning environments in jax","venue":null,"work_id":"50be7d59-d1a4-4bc3-ad87-d55b8a0d01a0","year":2024},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.600291Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:a96e317a15a07c9d770dcf2a01898fe01e7f28722bf65871d29814dfa7ba49eb","observation_id":"cf25001d-17db-4534-a18f-7a5581b6f219","resolution":{"observed_at":"2026-08-07T00:33:04.618180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.606168Z","title":"Policy gradient assisted MAP-Elites","venue":null,"work_id":"eedc69bb-9482-4f03-86d7-ccec2185ba98","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.650089Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:c86c6c24b503b1f1533629b710b13fad4e05d31070286ec72f79b956503ea2d0","observation_id":"6f73c65c-9e1d-49c8-be74-979b7d1236bb","resolution":{"observed_at":"2026-08-07T00:33:04.608896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.597895Z","title":"Discovering diverse solutions in deep reinforcement learning by maximizing state--action-based mutual information","venue":null,"work_id":"74c0774b-c54c-4923-b9ad-2ffb143fdf94","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.732003Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:56a13a7866e86745a02b142085116a33cddb4b1f6ff77f34c42927b3b9209c03","observation_id":"a166f64c-c237-412e-972a-f1dbb3340dce","resolution":{"observed_at":"2026-08-07T00:33:04.600764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-08-19T20:58:49.095458Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-08-07T00:33:03.800435Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.800435Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:2012d135ac570fba611e0a4a47fefba9a17cb3be13ca827698cc04536b500734","observation_id":"c0ed7339-82d8-44be-a7b7-a506a191fd40","resolution":{"observed_at":"2026-08-07T00:33:03.800435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.589511Z","title":"Effective diversity in population based reinforcement learning","venue":null,"work_id":"82ddd6c5-0b5f-4f45-8ba5-6d323df6befa","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.883178Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:71fbb3ef44d0ceb78340f81e1ba71ce1468c0e74a8c674e4d45cd1254e016629","observation_id":"47273825-0496-4a5f-87f8-5a271a79c99c","resolution":{"observed_at":"2026-08-07T00:33:04.592571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.580572Z","title":"Jaxmarl: Multi-agent rl environments in jax","venue":null,"work_id":"112a9c5f-d692-4720-8afb-f0a356ab83b9","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.948814Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:302ef0a39f854b49e5de9d8d4831c2f740419090c2d6b2b6507430bffa4a2acd","observation_id":"4d3691d9-59db-49ee-868b-4f9f7203e226","resolution":{"observed_at":"2026-08-07T00:33:04.583969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-08-14T21:12:24.197125Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-07T00:33:04.015747Z","title":"Evolution strategies as a scalable alternative to reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.015747Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:992798b00a4c3d2b1d985d9550e5c0b61b069163a9803e43e8ca54d517551939","observation_id":"cba07e3f-6afc-47cc-8173-ad5d6961a15d","resolution":{"observed_at":"2026-08-07T00:33:04.015747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.571953Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":"067e3fcb-c6f9-4f50-b3fa-c38ba1f29c45","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.098928Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:65e502616edc3ebb8459939b0045acf8e82540aeb36e6c350e0876ce25dc0ccc","observation_id":"e602c915-ec49-4297-8476-52b38f3e57eb","resolution":{"observed_at":"2026-08-07T00:33:04.575052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.163238Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.163238Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:58b1b22308109cb1511bdcde3bce0d7add93f2aa376c581a5b950a97410d2464","observation_id":"100cb00e-0586-444b-b90d-34a2793461b6","resolution":{"observed_at":"2026-08-07T00:33:04.163238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:33:04.252878Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.252878Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:eee1ab791c35e041c4d7616753b71d3ef96d53d8fd2d46bf17d79c3994211a8d","observation_id":"8ea88ba8-32ca-403b-9456-f0b60699cb2d","resolution":{"observed_at":"2026-08-07T00:33:04.252878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.557691Z","title":"Ball, Vu Nguyen, Binxin Ru, and Michael A","venue":null,"work_id":"e6c1cce0-009a-457f-917a-4e42a19ba0b2","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.332746Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:0095151bc594378cfe924ed8babf61094d075c189a67e431a10a3616c46330c1","observation_id":"c6be78c0-e1dc-45bd-92cf-e897ea2f2946","resolution":{"observed_at":"2026-08-07T00:33:04.560627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.548815Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":"92677260-f4e6-48be-a05e-2a2fb7a44ca1","year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.401624Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:3c24930fc01ea081a5279c81567b0dc12137c7622fca860085382e0838c5e7f4","observation_id":"1591528d-92f0-4345-a103-0f26b8bbe050","resolution":{"observed_at":"2026-08-07T00:33:04.552166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.13741."}