{"as_of":"2026-08-14T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:789dc50ed9571bcdb4100983ed62e8bd0733a1c9a1ac6dc1efa723b092f78d86","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:13:01.213190Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00388/citation-record","integrity":"/paper/2506.00388/integrity","json":"/paper/2506.00388/citation-record.json","paper":"/paper/2506.00388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.074379Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.074379Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:81a2a7556c7fac6ae907f5c3fbd2359f92518395e7c01dcc296559a3366524c7","observation_id":"250a93c1-e861-440f-b914-2164a8bd24a1","resolution":{"observed_at":"2026-08-07T12:12:57.074379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.500268Z","title":"G., Candido, S., Castro, P","venue":null,"work_id":"b3a772b8-47d2-42dd-a913-c12d8d4df6cc","year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.147263Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:2740c87d06c59a4c0da94e06bf50f996f6bd264b28802a43c1ecafd0abb29076","observation_id":"54d7213e-edb2-437b-95bc-fa5e10e26b29","resolution":{"observed_at":"2026-08-07T12:13:03.592044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.336400Z","title":"Learning to distinguish: shared perceptual features and discrimination practice tune behavioural pattern separation","venue":null,"work_id":"a5a2fe1f-a4c6-4a19-a490-39749dde10a5","year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.238918Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:453a73bcefd68490419415ba7e997b7f38af83349682ef875b7d1fb75597c68b","observation_id":"e04203ac-c923-4752-a3f6-a23e54f4bb58","resolution":{"observed_at":"2026-08-07T12:13:03.418448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.158833Z","title":"Active preference-based gaussian process regression for reward learning","venue":null,"work_id":"f50812e1-dbc8-42dd-ab7b-1c8198744b12","year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.330118Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:bd45e72ac98905d25ad4fabca6bf3e27f4fae94d511fee93fac4b90094dabaae","observation_id":"1a505b6a-ca0d-44e2-aba9-e49c090cce6d","resolution":{"observed_at":"2026-08-07T12:13:03.268428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.354573Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.354573Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:98a834a1d0013d029cfc1f29c4fbba6d6c27a597c7c5a9c144bd6ae5d0c645db","observation_id":"e479e1df-6574-48d8-a2e8-b097915e16e3","resolution":{"observed_at":"2026-08-07T12:12:57.354573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.439208Z","title":"and He, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.439208Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:db6fc57723fd0b643ce3e750a9c0846660596e7ad3c106d9b6e7373fa9448077","observation_id":"1bd4b567-0992-476d-aa06-2b0964c20d66","resolution":{"observed_at":"2026-08-07T12:12:57.439208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17257","last_updated":"2024-10-28T12:26:53Z","snapshot_observed_at":"2026-08-13T04:09:25.575346Z","submitted_at":"2024-02-27T07:03:25Z","title":"RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17257","snapshot_observed_at":"2026-08-07T12:12:57.502734Z","title":"Rime: Robust preference-based reinforcement learning with noisy preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.502734Z"},"links":{"cited_paper":"/paper/2402.17257","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:d95a3ebd491e27b25557ea1c80a8eebef6774fc268de9600a55a0ead72f8bf5f","observation_id":"d7ec4a76-b6b0-47f6-ae4f-ccec4cdd5be6","resolution":{"observed_at":"2026-08-07T12:12:57.502734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04190","last_updated":"2024-08-08T03:18:42Z","snapshot_observed_at":"2026-08-14T17:10:29.508677Z","submitted_at":"2024-08-08T03:18:42Z","title":"Listwise Reward Estimation for Offline Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2408.04190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04190","snapshot_observed_at":"2026-08-07T12:13:01.656376Z","title":"Listwise Reward Estimation for Offline Preference-based Reinforcement Learning","venue":"cs.LG","work_id":"ccfe2d4c-d4ff-4e0f-ad7b-2724526bc851","year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.547010Z"},"links":{"cited_paper":"/paper/2408.04190","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:66099beca09d8c6170f0374d6ba46ae38d59f60e6674cd85a4b0ed240791e73f","observation_id":"c9248b55-c092-436d-9845-69455364ba71","resolution":{"observed_at":"2026-08-07T12:13:01.753321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.626849Z","title":"Learning a similarity metric discriminatively, with application to face verification","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.626849Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:4f47cad3c4f152b43678c47cd593ed41ded5c22a907b43f79e1aa318ec1f3830","observation_id":"89a3358b-236d-486f-80f2-80e68e37d0a8","resolution":{"observed_at":"2026-08-07T12:12:57.626849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.702927Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.702927Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:36fe82003b6b38cb3cc6c14e28d99a0f4b3e4d10d45025d31b90bc128204f9f3","observation_id":"43919007-ec05-4297-9da6-36c5f86c37bd","resolution":{"observed_at":"2026-08-07T12:12:57.702927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-14T04:09:47.636898Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T12:12:57.766405Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.766405Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:98fea521678396d5461c08ff004d81f5cbc7cf78b5373d7eb6fdf1a26d1c4f8f","observation_id":"1a34d678-3436-4a3a-a4fe-65d1b7b3e432","resolution":{"observed_at":"2026-08-07T12:12:57.766405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-08-13T17:30:38.052991Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-07T12:12:57.859163Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.859163Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:5749016576e4dbfb391105c5f95560ad5dd92eea97a871ec30289d9e7be31248","observation_id":"abc8b36e-fc44-4deb-ad0b-d09b727f5b1d","resolution":{"observed_at":"2026-08-07T12:12:57.859163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.933451Z","title":null,"venue":null,"work_id":"065eac30-d211-48d8-9b5d-de3f230490ba","year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:57.997015Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:365ec1779f63a60b731adfca18aed9bed4bb28d886dad0b63a666e9193152e29","observation_id":"b45fc730-8cc9-4621-9f44-ee2ae67fa062","resolution":{"observed_at":"2026-08-07T12:13:03.000325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04451","last_updated":"2024-07-05T12:05:37Z","snapshot_observed_at":"2026-08-12T23:28:13.796639Z","submitted_at":"2024-07-05T12:05:37Z","title":"Hindsight Preference Learning for Offline Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04451","snapshot_observed_at":"2026-08-07T12:12:58.048180Z","title":"Hindsight preference learning for offline preference-based reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.048180Z"},"links":{"cited_paper":"/paper/2407.04451","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:c105d86c9d1daccdd7d5a0921a3664ca96ececa2279564a180774adec6f3d7cb","observation_id":"1179e094-1d9b-4423-bdc4-75bde49d1d28","resolution":{"observed_at":"2026-08-07T12:12:58.048180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.704351Z","title":"and Sadigh, D","venue":null,"work_id":"b4b44657-641d-4366-bb0d-85af6840d1f6","year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.112002Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:91e0199d30853f6dccdb6681dc73d9ac220e66733aaf60d417048d956596b50b","observation_id":"b71a3d6c-8600-487c-8108-c3687755c31a","resolution":{"observed_at":"2026-08-07T12:13:02.802723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.174843Z","title":"Reward learning from human preferences and demonstrations in atari","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.174843Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:c05a589907744e2b54c6a4d8f4d8a141699d8927a69754eaf941770ba0ca8b85","observation_id":"144323eb-6a86-404c-afb8-5cdfbfdcd49f","resolution":{"observed_at":"2026-08-07T12:12:58.174843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.408948Z","title":"Tuning in to how neurons distinguish between stimuli","venue":null,"work_id":"bd561586-239e-49e9-acd5-26862cf2fb82","year":2006},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.256962Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:222ce82e132fc1ddc985ec5e462a001e6b45c1fb145fa060595afe66bdcd8545","observation_id":"0378777a-f6aa-451c-8e86-d440816a9297","resolution":{"observed_at":"2026-08-07T12:13:02.486917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.249401Z","title":"Episodic novelty through temporal distance","venue":null,"work_id":"0688539d-9845-4ac5-b689-ecc0a32471c2","year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.309735Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:22b8151f3dcb1f335d833f00d35e60359f16975d6c40718f19ffddeb7edc149d","observation_id":"99d4ff69-fea4-443c-83dc-edd97301a97c","resolution":{"observed_at":"2026-08-07T12:13:02.287093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.118660Z","title":"Transferring policy of deep reinforcement learning from simulation to reality for robotics","venue":null,"work_id":"937c58a7-016c-4ed7-8f57-08c003cc0fe2","year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.354488Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:66c44fe90748ddcf0ad3acafd446ee688fa91cc89c53d7ce5a1d3c81d46d321b","observation_id":"769b3f9d-210d-4324-9761-b8f37d1b5367","resolution":{"observed_at":"2026-08-07T12:13:02.157844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.463092Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.463092Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:ffeae0fed7da8f911f927599641ad28c37962f6530c2b2c1ae36bc53bdc2c003","observation_id":"e33ead37-5bc7-4215-84bf-5ac5a8506a86","resolution":{"observed_at":"2026-08-07T12:12:58.463092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16217","last_updated":"2023-06-09T07:48:49Z","snapshot_observed_at":"2026-08-13T11:33:14.399418Z","submitted_at":"2023-05-25T16:24:11Z","title":"Beyond Reward: Offline Preference-guided Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16217","snapshot_observed_at":"2026-08-07T12:12:58.566244Z","title":"Beyond reward: Offline preference-guided policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.566244Z"},"links":{"cited_paper":"/paper/2305.16217","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:c368926b0511555791471fe3dff6682bcac7c12526c4a24feb0d60acc129e876","observation_id":"39893ad9-687e-45ad-949f-f43fe432dbf1","resolution":{"observed_at":"2026-08-07T12:12:58.566244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.035698Z","title":"Preference transformer: Modeling human preferences using transformers for rl","venue":null,"work_id":"a3ce1b70-1f92-44e7-bd87-76e811dde55c","year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.705934Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:55ad5f4ba2a650f15aef382c6e0a3a49a7eb18f76f6b3d1475aa0b7d278680d5","observation_id":"f1aa0140-78bb-4265-974a-256780365eb6","resolution":{"observed_at":"2026-08-07T12:13:02.066230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T12:12:58.782816Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.782816Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:53de251e319a53795b1fe9eb461d36aec6268946b3dcd2a8d3b332a37cb6a1ec","observation_id":"573e15d2-3710-4a67-9edd-851b0dc63bef","resolution":{"observed_at":"2026-08-07T12:12:58.782816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.924071Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:58.924071Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:81a15cac9f0037d0e1805b4f36fc7adcd8ddab10f6256fa55b2054d71dfe6d3b","observation_id":"90389d52-fd13-4079-84f8-66984933191a","resolution":{"observed_at":"2026-08-07T12:12:58.924071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-13T19:07:06.766259Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-07T12:12:59.030007Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.030007Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:8dda03494c634d0587c3be134541bb33dc907ff6d56287b3bf17eaf96d9d4d98","observation_id":"8190da58-22ab-43de-a3f7-162654f53e83","resolution":{"observed_at":"2026-08-07T12:12:59.030007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-08-13T17:39:32.161498Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-07T12:12:59.151835Z","title":"B-pref: Benchmarking preference-based reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.151835Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:83d195434e63f670ee2e610b95d6e95189040d0625a3542a5538c34d0a2fdb79","observation_id":"6c8e3ae6-9185-403b-869a-96c023284f05","resolution":{"observed_at":"2026-08-07T12:12:59.151835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.894058Z","title":"Survival instinct in offline reinforcement learning","venue":null,"work_id":"b61b368e-dfb8-4e69-be3c-3b2c732c211a","year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.288060Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:48adf66f89f210c8f2a6ba48034ef8c2751987e92b6162a439c47813d1d1f147","observation_id":"f3ab3b8f-f2e9-4a75-93fe-7b11dd15946e","resolution":{"observed_at":"2026-08-07T12:13:01.970434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12401","last_updated":"2022-05-24T23:22:10Z","snapshot_observed_at":"2026-08-13T15:37:42.264809Z","submitted_at":"2022-05-24T23:22:10Z","title":"Reward Uncertainty for Exploration in Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12401","snapshot_observed_at":"2026-08-07T12:12:59.440374Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.440374Z"},"links":{"cited_paper":"/paper/2205.12401","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:1f9aa846779d7fb9a40cb114e01d2eea087e99cecc4f63cb72a587010e8e5986","observation_id":"1387e94c-3fdf-408f-b021-b70d45fbb5b9","resolution":{"observed_at":"2026-08-07T12:12:59.440374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:59.633355Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.633355Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:0d6ac83fb7f9410bdd970b91f93ba1250412e572922aea40b8de02b1d7bd752a","observation_id":"8e0ac5bf-e130-47d6-adab-5a92f2968f88","resolution":{"observed_at":"2026-08-07T12:12:59.633355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12130","last_updated":"2025-05-13T14:30:16Z","snapshot_observed_at":"2026-08-12T22:59:33.381256Z","submitted_at":"2024-08-22T04:54:25Z","title":"S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12130","snapshot_observed_at":"2026-08-07T12:12:59.815667Z","title":"S-epoa: Overcoming the indistinguishability of segments with skill-driven preference-based reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.815667Z"},"links":{"cited_paper":"/paper/2408.12130","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:d6a8b2a332f0440ec436b37dc71669b0d1e47ba95569ffed39155445878e1046","observation_id":"f89b50c1-8f96-4fc7-b1c9-87a7b865bfcf","resolution":{"observed_at":"2026-08-07T12:12:59.815667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17098","last_updated":"2025-03-10T07:33:32Z","snapshot_observed_at":"2026-08-12T23:35:46.028989Z","submitted_at":"2024-06-24T19:36:45Z","title":"Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17098","snapshot_observed_at":"2026-08-07T12:12:59.969023Z","title":"Learning temporal distances: Contrastive successor features can provide a metric structure for decision-making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.969023Z"},"links":{"cited_paper":"/paper/2406.17098","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:69cc5a4eddb3fa0dda708ed3d5dc80fd5ef2a45988f3426c2a0181d3afb94033","observation_id":"faf88960-dd49-4059-a571-3472806c415b","resolution":{"observed_at":"2026-08-07T12:12:59.969023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T12:13:00.091060Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.091060Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:b1d2be88594ed804ce954a2f9b9d94c6377c9d93d67e0e1c919569aa1c31fd50","observation_id":"c95aa10b-79be-4370-a553-f3c490942db1","resolution":{"observed_at":"2026-08-07T12:13:00.091060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:00.201111Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.201111Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:b54dee051833394a8c11773921c509b9e197345588321774a6fbe1b91440725d","observation_id":"4c46c2c8-2b1f-4eb0-a9a4-b39f94a9886a","resolution":{"observed_at":"2026-08-07T12:13:00.201111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-08-13T22:38:24.304757Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-08-07T12:13:00.332041Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.332041Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:0608e67de2827d8b96aa9c2647b4a269e320bae915d62eb66d5e7bb786c14abf","observation_id":"cba3728a-2163-4aaa-8eee-1e95afce2404","resolution":{"observed_at":"2026-08-07T12:13:00.332041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-14T22:59:27.438293Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-07T12:13:00.476431Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.476431Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:f6cf1d64d8b3a2469c7471f99fc782a4a65d4fd24a88995c7684c1bed752ffe5","observation_id":"2d234ffd-ef7e-4178-98fd-518cc1164d1e","resolution":{"observed_at":"2026-08-07T12:13:00.476431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01392","last_updated":"2023-01-03T23:52:16Z","snapshot_observed_at":"2026-08-13T13:10:07.405177Z","submitted_at":"2023-01-03T23:52:16Z","title":"Benchmarks and Algorithms for Offline Preference-Based Reward Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.01392","snapshot_observed_at":"2026-08-07T12:13:00.672841Z","title":"D., and Brown, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.672841Z"},"links":{"cited_paper":"/paper/2301.01392","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:5d6abd32438eb1ca95bf959b0b6139289ccf6a8b33eece2de266c67099d18225","observation_id":"3931ac7b-a868-4eec-9af1-bf714c641b6c","resolution":{"observed_at":"2026-08-07T12:13:00.672841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:13:00.774609Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.774609Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:ccff6d046d3cc7f591c9c65c732cbfd80bbe9ded40abc060fafc6b57e0a2e147","observation_id":"17e588d6-466d-4205-938a-469714d91c97","resolution":{"observed_at":"2026-08-07T12:13:00.774609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11774","last_updated":"2024-05-08T15:58:02Z","snapshot_observed_at":"2026-08-13T12:56:26.619516Z","submitted_at":"2023-01-27T15:18:54Z","title":"Reinforcement Learning from Diverse Human Preferences","version":3},"cited_work":{"arxiv_id":"2301.11774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.11774","snapshot_observed_at":"2026-08-07T12:13:01.313466Z","title":"Reinforcement Learning from Diverse Human Preferences","venue":"cs.LG","work_id":"dc209747-9f86-444c-8789-0655b8d8bfe5","year":2023},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.884525Z"},"links":{"cited_paper":"/paper/2301.11774","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:c6f28d60143d58a0711063d87edb9eb672ae56def36dbe8b23d74dde55a5fe73","observation_id":"38bed9a6-7783-490b-a08f-063e354bd693","resolution":{"observed_at":"2026-08-07T12:13:01.391953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.053360Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:01.053360Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:0932de9c08d09d2e52b0f0a93dd9f80d32bdecc6fbfd3bd585b057906cd0d835","observation_id":"6cb82dbc-6008-47ce-8d91-09beca49acdc","resolution":{"observed_at":"2026-08-07T12:13:01.053360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.213190Z","title":"and Lu, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:01.213190Z"},"links":{"citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:2f8f7b03e6314b90e465273ea43a945acdb10eb501359ac416929b0cee8b3a2e","observation_id":"f5f1a679-ecbf-42ec-8793-0f69ebc1ae7a","resolution":{"observed_at":"2026-08-07T12:13:01.213190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:52:49.452533Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.00388."}