{"as_of":"2026-08-14T19:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5065cd69080f50f707449a9d13700199fd5d6f67e88fa670553fc380d5fbf152","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:53:13.730009Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12529/citation-record","integrity":"/paper/2506.12529/integrity","json":"/paper/2506.12529/citation-record.json","paper":"/paper/2506.12529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.634096Z","title":"Sutton and Andrew G","venue":null,"work_id":"6ec7273f-03e3-4d0c-a254-c7a56eb161e7","year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.574686Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:8d1106494b9f30f09d5c8b4b679a05731895f09e9c0a79b97a564f77e01211c9","observation_id":"a838ea7f-1367-4cab-ade4-ff13cad9272b","resolution":{"observed_at":"2026-08-07T00:53:14.636568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.626716Z","title":"Reinforcement learning can be more efficient with multiple rewards","venue":null,"work_id":"49397a6c-4295-4b25-a19d-c90e7cc23eb8","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.577558Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:38ea849bea4b0abd0b9977e2b8213e59fed24a9c1581c3408938929811157645","observation_id":"e41adb7b-fc05-47b2-8087-650acdee650b","resolution":{"observed_at":"2026-08-07T00:53:14.629294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.580172Z","title":"Learning Agile Robotic Locomotion Skills by Imitating Animals","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.580172Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:9673d45381ab88a84d1a83562bd5677d0db459d7a3d7c547b11b240fdea95da3","observation_id":"31528ee8-6aa9-4fcc-830b-25e50396a312","resolution":{"observed_at":"2026-08-07T00:53:13.580172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.583522Z","title":"Deep object-centric represen- tations for generalizable robot learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.583522Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:c6d164a768607bd507f75606250c93edf46936336f5c0cf423a1ef808507e436","observation_id":"668de56f-1921-46d4-b2ec-7ffbe1be87e2","resolution":{"observed_at":"2026-08-07T00:53:13.583522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.619931Z","title":"The ingredients of real world robotic reinforcement learning","venue":null,"work_id":"50187397-04eb-4634-9298-5e66501ffc8b","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.586670Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:897386be87637917a999ddbfdfad365db43f070c31b4f42133b9bae8b33357fb","observation_id":"b89ad36b-5273-462d-9fa7-3068b8804939","resolution":{"observed_at":"2026-08-07T00:53:14.622631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00957","last_updated":"2023-03-02T04:24:29Z","snapshot_observed_at":"2026-08-13T19:42:31.789282Z","submitted_at":"2023-03-02T04:24:29Z","title":"Preference Transformer: Modeling Human Preferences using Transformers for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00957","snapshot_observed_at":"2026-08-07T00:53:13.589096Z","title":"Preference Transformer: Modeling Human Preferences using Transformers for RL, March 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.589096Z"},"links":{"cited_paper":"/paper/2303.00957","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:5543a439f876953b10637c0f1b6148bb7377c0fcb8d739d352f64d92b29ba35e","observation_id":"1b95cad8-1d9e-4eea-b430-9a45b1b06e2e","resolution":{"observed_at":"2026-08-07T00:53:13.589096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:53:13.591993Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.591993Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:a14c8ae248554f84acc7319c370c76d72c8fa219bf4ef26731096324e27907aa","observation_id":"1211a9fc-d637-440a-8732-934998ae1c9a","resolution":{"observed_at":"2026-08-07T00:53:13.591993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:53:13.594860Z","title":"GPT-4 Technical Report, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.594860Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:26656fb7c3e628ddf66ba2fd1f8adb59075467a085ce134d9f71b88e5a9ce01f","observation_id":"bcdaafa4-37b0-4089-8eca-e979692aa58c","resolution":{"observed_at":"2026-08-07T00:53:13.594860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.612374Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"f7ba15f9-617a-41c9-9ce0-f7006116a352","year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.597295Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:0426cf8e1750f86fad4b47a8473d8c60d0446fe59b58344dc2a4e50c817c7434","observation_id":"69641a7f-1abc-4504-9b55-3c54a6ceec2f","resolution":{"observed_at":"2026-08-07T00:53:14.615042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:53:13.599621Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.599621Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d1928eee668d32f0c9870f5b98ced9471f8545d07cfbc462b0b8873c979e830d","observation_id":"19b879c1-f247-4979-b6df-efeccc565ea6","resolution":{"observed_at":"2026-08-07T00:53:13.599621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.602307Z","title":"Active Preference-Based Learning of Reward Functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.602307Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:450b75fc49a2c10d83c239f07367e46ac493c2e80bb940356b73706c6345222d","observation_id":"a2f8fbe3-ce5d-4f95-a555-30270e9eab9b","resolution":{"observed_at":"2026-08-07T00:53:13.602307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.605833Z","title":"Deep Reinforcement Learning from Human Preferences","venue":null,"work_id":"83f7d705-c33e-469c-a88e-60bc1a319e40","year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.604747Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:1f45ca727e9f2a45b370e341523f9872202539b8cdb7dfbe13faf985c7f061a1","observation_id":"ca135057-2688-40fe-a535-3bc88ad74e26","resolution":{"observed_at":"2026-08-07T00:53:14.608347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.599101Z","title":"A Survey of Preference-Based Reinforcement Learning Methods","venue":null,"work_id":"8a95834f-db96-4b71-b8e8-fde757e84ea7","year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.607066Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e791c7a39491bf8e124e09cd661ebc17761ad12c4c1b610aa6a4734ae3a42847","observation_id":"f60f215e-05b2-4d97-b993-3dbe38972c4d","resolution":{"observed_at":"2026-08-07T00:53:14.601692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.609596Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.609596Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:564ab790656617ce2d7f0d34bb8e753c466ee93ffb5d5fd0f3a54288eb47ccbb","observation_id":"dcc01f40-2cf0-4b44-9e41-5b13da365c11","resolution":{"observed_at":"2026-08-07T00:53:13.609596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.592120Z","title":"Smith, and Pieter Abbeel","venue":null,"work_id":"f54374df-71b9-49a3-89bd-82e8f209c3c4","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.611610Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:ea0da94b2cc4de16485e687eae2d5c0f6c469b91a7f271e840251f1f7924c7f1","observation_id":"bbed6be8-6b7e-4898-b8a2-4b2515e6542b","resolution":{"observed_at":"2026-08-07T00:53:14.594628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.577145Z","title":"Few-shot preference learning for human-in-the-loop RL","venue":null,"work_id":"fb65bcc9-542f-4c90-8473-0b8afe0fe3d4","year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.616579Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:68c4a496c037856095d5ad952eac96c9e2543bf4c3423b52f4cc6c945a116c9a","observation_id":"5a1f93fd-7264-4d23-8023-83386e640017","resolution":{"observed_at":"2026-08-07T00:53:14.579789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.570116Z","title":"Bradley Knox, and Dorsa Sadigh","venue":null,"work_id":"f0d73b80-bbe9-4cfa-8459-bccbf0b3e4b5","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.618745Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:7148345aa5f7748a72a5a4b1c26a2955ddf3bee15df3d97c520606952919afe2","observation_id":"886092de-c884-4349-aee7-dec74b9d0023","resolution":{"observed_at":"2026-08-07T00:53:14.572904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.556912Z","title":"Inverse Preference Learning: Preference-based RL without a Reward Function","venue":null,"work_id":"0e7e4e9f-19e9-4999-a4b7-d357db90e1c2","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.623886Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:83a83bce8761cc1551718c1331dd04a258560b89f581c95e501a226b862a46f1","observation_id":"aa775772-5afe-4056-bb72-43b3df819895","resolution":{"observed_at":"2026-08-07T00:53:14.559555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.549957Z","title":"Direct Preference-based Policy Optimization without Reward Modeling","venue":null,"work_id":"2bf8da22-5a25-4530-914f-4a1b9ebb1d77","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.626123Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:c022ff02e2d0f292d831d0833cd5f0f365ae03ef31c72949f844d8cf9f478d07","observation_id":"327d9590-55cc-4c53-9ddb-7df41ee30b9b","resolution":{"observed_at":"2026-08-07T00:53:14.552744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.543295Z","title":"Beyond Reward: Offline Preference-guided Policy Optimization","venue":null,"work_id":"5709d771-08de-4ee6-a02b-d86b6107e472","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.628391Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:f3daba171ba8b153c7e1fe001419a54f609c094d204d663a6fd3541d49647690","observation_id":"364218c0-d7c7-44f6-a6e0-26c1e2dd405c","resolution":{"observed_at":"2026-08-07T00:53:14.545970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.536016Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":null,"work_id":"d848d41c-51ef-4134-8ec3-82e501026a6f","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.631200Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:537d783183f0cd468755bf5b7ca811225f24499c7044f3bce8e3fd302faca347","observation_id":"cba5540a-8275-4414-afb8-118e0aa90b58","resolution":{"observed_at":"2026-08-07T00:53:14.538656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.528759Z","title":"Learning to Discern: Imitating Heterogeneous Human Demonstrations with Preference and Representation Learning","venue":null,"work_id":"36efbff0-074b-4b18-97ea-52311c50ac48","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.633432Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:6014969ae59c8bc08b85facc252505ef0060d2802e51ec5d56558945640c4e39","observation_id":"1cc52139-f6aa-46bc-8f50-89faafdb063a","resolution":{"observed_at":"2026-08-07T00:53:14.531895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.521913Z","title":"Rethinking reward modeling in preference-based large language model alignment","venue":null,"work_id":"e6f7eb57-3347-45ed-b110-0084a2a6d685","year":2025},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.635700Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:153450d3adf2634aad5fa1333f6f36f38ad3905bec5e89836a8199727617e534","observation_id":"fb61f357-0b37-4a7c-bee7-13dff66eaae2","resolution":{"observed_at":"2026-08-07T00:53:14.524528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.515136Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":"3e5e4b22-788c-48a3-9958-a44eb18b5740","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.638150Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3b2d2d17eddeace7d57aceff16297db117a02cf9b47437537895160a33fe6613","observation_id":"4533caba-3b52-4501-8e24-c7b60990f44a","resolution":{"observed_at":"2026-08-07T00:53:14.517863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.508692Z","title":"Nash learning from human feedback","venue":null,"work_id":"919a5679-00d9-4497-9221-f5a7b4e1aeaa","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.640321Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:0bcac420898ee44e87974bb463df5c365ce084a95031b24060335497bfcc906d","observation_id":"8bad5c92-683e-4ad4-a002-cc55117e83cb","resolution":{"observed_at":"2026-08-07T00:53:14.511138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.501656Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"ec0d5eec-c41d-4cf9-a50e-97edb4fdcb1e","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.643844Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d09f9fbece74924e80b72f31bd93b22085efa65dd1761b3ee86c030821abb439","observation_id":"13bdd45a-96b2-43aa-865f-65b560504c57","resolution":{"observed_at":"2026-08-07T00:53:14.504228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.495103Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","venue":null,"work_id":"ce3ca3d5-2221-4aee-805f-5970cb06fc89","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.646342Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:31eb70843b545c4eff26278b5c60f64a58085826410c3f39c8c4d102d258e62c","observation_id":"70cd97ea-e593-49fa-9ef1-b44d30a25af8","resolution":{"observed_at":"2026-08-07T00:53:14.497602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.648723Z","title":"Intransitivity of preferences","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.648723Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:fe1a397b6028ad77f898ddcdd39dd092bb16a3555d35425a5d8eb0d3f392eb15","observation_id":"681f80ec-a3bf-4e3e-96a8-0c1c4f32eda0","resolution":{"observed_at":"2026-08-07T00:53:13.648723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.488787Z","title":null,"venue":null,"work_id":"e865330c-b626-4ea4-b1ce-90a2066030f6","year":1954},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.651354Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:c1c1ba06379b9d6cc0f0c9fc362fdec8dc0d43f6a5adbbfe064708489f6e4526","observation_id":"a5f4cb82-180f-41ad-bc80-26a2ee1c3fe5","resolution":{"observed_at":"2026-08-07T00:53:14.491103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.481662Z","title":"RIME: robust preference-based reinforcement learning with noisy preferences","venue":null,"work_id":"3253ce64-e6bb-4b74-891e-42f2c510d0dc","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.653713Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3ccdd1544c7f2a3ad30a337e479e3d33dfad3d07dae3d1354123e7c14a5752ca","observation_id":"fa32ebb1-b6de-484f-865b-45bde68c1df8","resolution":{"observed_at":"2026-08-07T00:53:14.484703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.474686Z","title":"AlpacaFarm: A Sim- ulation Framework for Methods that Learn from Human Feedback","venue":null,"work_id":"385ef814-6576-41ae-8b7a-7230ee2079e4","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.656095Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:0c17b16f016fb9eb9661054225703cb581416bee267e4c1a64fa14d12a75de2d","observation_id":"e1b4705a-362a-4749-a5dc-5b177b88445a","resolution":{"observed_at":"2026-08-07T00:53:14.477470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.467268Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"92c36552-c19f-473e-87d1-d0615f517460","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.658610Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:df918e5d33500b45c781e98877d7eb34e1044432939ff3e999f1e5e40b8ff6c0","observation_id":"08f7bed2-0bca-414a-bf50-9ebb75e284de","resolution":{"observed_at":"2026-08-07T00:53:14.470636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.460289Z","title":"B-pref: Benchmarking preference- based reinforcement learning","venue":null,"work_id":"08bc6aa7-d447-4e76-9da8-ada3dc53d886","year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.662379Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:20e9b4c46c667656872e95026a60ae739bb9c7ac3408533a7e25143b45fa55aa","observation_id":"49ca57c0-ffb5-4bfc-bdde-debf0a6536f2","resolution":{"observed_at":"2026-08-07T00:53:14.462842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.453690Z","title":"Rethinking decision transformer via hierarchical reinforcement learning","venue":null,"work_id":"05081d12-310b-4970-8c01-5ac0a3d28f6c","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.665757Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:9362b7e4a500107e05af97c46c950ee3c9266480fbb9772efeb538c63d95cfb4","observation_id":"f35ae298-7b63-4b7c-b111-39ab708b06b1","resolution":{"observed_at":"2026-08-07T00:53:14.456224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.446928Z","title":"WHEN SHOULD WE PREFER DECISION TRANSFORMERS FOR OFFLINE REINFORCE- MENT LEARNING? 2024","venue":null,"work_id":"548c3909-7018-43ee-abce-1cde5f912af5","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.668108Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3b13a92bb26f6ff10a01176fa6f956c6dc67c9708bb5b1f39092bc1ce18f814e","observation_id":"93960999-efcb-4eb0-8a44-5b54d0d724f8","resolution":{"observed_at":"2026-08-07T00:53:14.449568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.440204Z","title":"OFFLINE REINFORCEMENT LEARNING WITH IMPLICIT Q-LEARNING","venue":null,"work_id":"ef68545d-07a9-4c82-a1e0-4d7e6121a456","year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.670493Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:4e2ba7020e30a9511431a0ba2826219898e287b15844b51d220473293cffd85f","observation_id":"f7b64e6a-3356-4f98-b0e9-4dda53306843","resolution":{"observed_at":"2026-08-07T00:53:14.442807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.432763Z","title":"Preference Alignment with Flow Matching","venue":null,"work_id":"687ef326-3044-4095-a0a6-596c0a9f4018","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.672687Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d74babfe426eb156b1fd6f4b02ac00a04ca2f141a79b352572733b2d9c1740fd","observation_id":"fd154f9e-c94f-4d55-adf5-b1d0e5a085e7","resolution":{"observed_at":"2026-08-07T00:53:14.435365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.425623Z","title":"Flow to better: Offline preference-based reinforcement learning via preferred trajectory generation","venue":null,"work_id":"cb7373c5-9475-401d-bdcc-d703fa34ff45","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.675423Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:846d92babd69625e07ea6ed2a01206a83acb65bb8bd9a870fb611d9eace29c94","observation_id":"275949b1-55c3-4527-a651-7e1c23fb4b66","resolution":{"observed_at":"2026-08-07T00:53:14.428600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.677623Z","title":"Denoising Implicit Feedback for Recommendation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.677623Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:f078a5c3dd53dd513195662355b4de8186b72e400fe3f0c158c22ae245667d78","observation_id":"cd767918-e406-4296-b1ad-44c438625715","resolution":{"observed_at":"2026-08-07T00:53:13.677623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.417112Z","title":"mixup: BEYOND EMPIRICAL RISK MINIMIZATION","venue":null,"work_id":"d7a9befe-6e62-4ce9-aef3-a90f1444cc02","year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.679660Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:9177633cb56a390a3e38a54b9efdd11b9bc302190bad3bc34623493275e6a966","observation_id":"356483ba-d9a8-4434-8c00-6fd4d6b272cb","resolution":{"observed_at":"2026-08-07T00:53:14.420313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.410270Z","title":"Co-teaching: Robust training of deep neural networks with extremely noisy labels","venue":null,"work_id":"7feae81a-edb2-410f-a2c5-0325f1ad8b51","year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.681877Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:fa0d6f1ecaaff80cf79ec90b247b6add9c64ce8b3d46cd910b47e1da930cf657","observation_id":"be9b2e01-c247-47f0-8baa-332bbc521971","resolution":{"observed_at":"2026-08-07T00:53:14.413068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.403166Z","title":"Does label smoothing mitigate label noise? In Proceedings of the 37th International Conference on Machine Learning, volume 119 of ICML’20, pages 6448–6458","venue":null,"work_id":"e7dc436b-6be3-40d4-bf53-0031d9b6a8b3","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.684352Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:84a6642cb6f0dbf853b5a4334221489007af35a1eae46320e003d72b7cb990d7","observation_id":"29d4218a-fc9c-49e8-aa23-01dd9802a5bf","resolution":{"observed_at":"2026-08-07T00:53:14.405932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.686484Z","title":"Learning from noisy labels with deep neural networks: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.686484Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:7ae4dcd20020a77ec07c478010b8940213f6d4a5b45bc9ea527023c4037f8df4","observation_id":"5bb06fb2-59c1-4f04-81d9-f9e6de1d2d0b","resolution":{"observed_at":"2026-08-07T00:53:13.686484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.396376Z","title":"Attention is All you Need","venue":null,"work_id":"d273e22b-612c-4a44-bf4b-b59b4f39df5f","year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.688693Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:f9640a1d210a31015fa281ed30e2756b3f2d7607f8c35c116b846906a6283bdc","observation_id":"340f57f2-d046-4e68-93fb-8f4a829786b0","resolution":{"observed_at":"2026-08-07T00:53:14.399011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.389639Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","venue":null,"work_id":"153b429c-3bf9-4766-b0bf-636d0b7c3249","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.691043Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e242902be464b7ebc7c8217c1ab1a286bb0abc383347d678a22b6038da76d687","observation_id":"07b25ea8-2a8e-4604-810c-a4532a8e2b03","resolution":{"observed_at":"2026-08-07T00:53:14.392260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-14T04:09:47.636898Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T00:53:13.693302Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning, February 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.693302Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:b7fdf90de77b1eb7ac6f969d738519da0acef80be7bb8bc41112a3824b65aeea","observation_id":"d4dcb6c3-5bc3-4569-a471-ca88d75bbcca","resolution":{"observed_at":"2026-08-07T00:53:13.693302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.382657Z","title":"D4RL: Building Better Benchmarks for Offline Reinforcement Learning","venue":null,"work_id":"b503cef8-5665-425d-907b-005d35539749","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.695735Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:6f33038daac4bfd88e3c350469d89a5c5a66ae2373f3a6d85ae33842cb6ffa62","observation_id":"ebefa7eb-9474-40c3-84b9-61dc1a853f1b","resolution":{"observed_at":"2026-08-07T00:53:14.385421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.375473Z","title":"URL https://www.gymlibrary.dev/environments/ mujoco/index.html","venue":null,"work_id":"e8ab890c-6cb4-44c4-b9f1-5a1e63b5dc5f","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.698093Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:b753f2a4c81f412cfe29697dcc42966af162948f34ad9b8f152ae7f1306960ca","observation_id":"0c06b20e-a5dc-42b0-86c5-cf226630a8c7","resolution":{"observed_at":"2026-08-07T00:53:14.378249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.367927Z","title":"Offlinerl-kit: An elegant pytorch offline reinforcement learning library","venue":null,"work_id":"8766d03f-4f21-4c58-b9f8-89b4a87fc2ff","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.700406Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:bbff4df76d6203e90ece31e5a79b889fdc45bea9d5d68cd19368aaa097b454f2","observation_id":"5883a3ed-b7f8-4bac-8410-542612030a70","resolution":{"observed_at":"2026-08-07T00:53:14.370970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.360136Z","title":"Hierarchically decoupled imitation for morpho- logical transfer","venue":null,"work_id":"4f40fc06-7757-4283-9216-a11b5827f0d2","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.703454Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:89c0d83c985dcfcb96b0a502a9d893788b6ef7bfb78e46178afa2dd350c27415","observation_id":"acc20467-b73a-4e61-aafb-0e89c97011d2","resolution":{"observed_at":"2026-08-07T00:53:14.363018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.351697Z","title":"PEARL: Zero-shot cross-task preference alignment and robust reward learning for robotic manipulation","venue":null,"work_id":"e4778c17-cf26-475b-9c7b-2db975f4389d","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.705831Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:4df9a37827f404f777ec7672c0c488af240fd01a8ccc77e85f3ffde59c22b044","observation_id":"b8b6faf0-90c2-4efb-a873-f36946864a93","resolution":{"observed_at":"2026-08-07T00:53:14.354877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.708152Z","title":"Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.708152Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e8f6f0dde927c39a7020026d6daf67d6b5c6e82356ac87ab17a2b45b66772aca","observation_id":"faa778ae-004a-4dde-8ba4-0f0d7a677f57","resolution":{"observed_at":"2026-08-07T00:53:13.708152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.710490Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.710490Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:78a1b4cd3909ece0e173317ff30d2e0f209883ce89b8863f3f28631edbcda495","observation_id":"69bc5927-4172-4956-8c45-9083497c7694","resolution":{"observed_at":"2026-08-07T00:53:13.710490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.713036Z","title":"dm_control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.713036Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:1369ac3bd0cca67df85b3ba40572861776ad20ae5cf843e50551d15417316a06","observation_id":"ab1552f6-f733-4b52-9d09-1b90227dd761","resolution":{"observed_at":"2026-08-07T00:53:13.713036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.343704Z","title":"URLB: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"cc508840-8f9c-4404-9af2-67d7fbf3edbe","year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.715496Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d04a066e512a53c5636f604227378e8e02c148eba945c4e2661abed067acd6fa","observation_id":"8e0ccee2-5793-45ba-b7b4-5e6d7602df08","resolution":{"observed_at":"2026-08-07T00:53:14.346513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T00:53:13.717937Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.717937Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:2619ddd2067e71f0aa8e0eb127de64ce738d1a9b3f45c488d9b9b2c16ff5df2a","observation_id":"103bccc0-2245-448a-b121-76970064a4ac","resolution":{"observed_at":"2026-08-07T00:53:13.717937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.336079Z","title":"URL https://docs.pytorch.org/ docs/stable/generated/torch.nn.TransformerEncoder.html","venue":null,"work_id":"417e1aa9-58ad-495b-9d3c-ddc909699ed1","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.721084Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:40d166723e21cd0f428ed11853fe40724ff85854793bc2e7cbfbe2effbe5e5fb","observation_id":"ce58efbb-6332-4e03-81a4-6bd802df36c9","resolution":{"observed_at":"2026-08-07T00:53:14.338969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.328033Z","title":"URL https://www.gymlibrary.dev/environments/ mujoco/hopper/","venue":null,"work_id":"dd7128dc-14ed-4408-b31d-980db222b870","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.724721Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:77d846d0cb027043685f4926989f7ef765fc4f10c4d47aa2eabca15fa5261a71","observation_id":"9c3c1e64-16a1-4f96-92c9-bfcd397821ca","resolution":{"observed_at":"2026-08-07T00:53:14.331172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.319949Z","title":"URL https://www.gymlibrary.dev/environments/ mujoco/walker2d/","venue":null,"work_id":"5d2c6b35-53d8-43c9-92a7-05177df7b319","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.727226Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d9913544dfacaa7cddd791defa2777b88f7853cfb4f57dccae4d416308bd16ae","observation_id":"26b71533-3a9e-45e8-96ae-1e3ad80676d8","resolution":{"observed_at":"2026-08-07T00:53:14.323213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.310831Z","title":"For the Franka Kitchen tasks, we use the preference datasets from An et al","venue":null,"work_id":"fda3b310-bfbe-4588-9c0b-c124a8564276","year":2000},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.730009Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e4ce3571fbf48fdb5f2e6a8471f9c72e8a556afa8a7073e48cf5ec3149f1da5f","observation_id":"ab7ec7ee-36e9-419b-9380-ac83076703d1","resolution":{"observed_at":"2026-08-07T00:53:14.314920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.584659Z","title":"ISSN: 2640-3498","venue":null,"work_id":"485c2b1d-e571-4063-aa7e-99333fa993ce","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.613923Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:b0c7e6f1c02d51c5a8c5c9bbd867a68b60496ea500bcee15bac1f7f73526c31a","observation_id":"41a941b2-d2f4-404f-8b60-2b89f0b89425","resolution":{"observed_at":"2026-08-07T00:53:14.588090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.563560Z","title":null,"venue":null,"work_id":"a3a9d1da-c5c8-469f-9eb5-2d156440f673","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.621171Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3e211159402397fea21f377018ce9f4f0b1fbe7700861b4b19ef56a5e124395c","observation_id":"0347b73b-0a39-4a05-b278-31a057847404","resolution":{"observed_at":"2026-08-07T00:53:14.566095Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T15:01:19.045163Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2506.12529."}