{"as_of":"2026-08-17T07:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28db552cea0ca4bf89cfc0b5496b2f11e8951c2db6096be08a6ae43a720071aa","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:22:51.007376Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.11982/citation-record","integrity":"/paper/2606.11982/integrity","json":"/paper/2606.11982/citation-record.json","paper":"/paper/2606.11982"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"NeurIPS Datasets and Benchmarks Track , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:953fb638161b20689a4299c6f42d32cfd20032184557f08de8a9b036f3ba006a","observation_id":"acd44dbf-29af-4b70-97ee-d018374f89bc","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Journal of Machine Learning Research , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:b7d8c5d19a8f39f46e50d22014a8699fc10008be14ab33723b4e7dfdbb6d85d0","observation_id":"81578717-6903-46bf-a39a-24737ecb80f3","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 37th International Conference on Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:a4f3dfe79574210deda6b0b9694a1145a8d3f90ae8d025d093d095259a13f43f","observation_id":"5ab03840-8823-4ec9-bf6b-61095e9df7cf","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:61a626243a58af7fc82b1cb424f297faed1be6a814922aa1d0f176b9204c1e93","observation_id":"c44413fc-bfd2-4ed5-8dd6-d254581798a4","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 41st International Conference on Machine Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:7fcb926643dcfc064b19a5b8e8315ea4a81c3728b42d727a360fe672cdc834c2","observation_id":"9ab2b5ad-7be8-4b6b-bf2c-7d9eec15d349","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:d8eead4cc4dc54532bf0128536c59031a4758abd1e7514724f46cb4bcada95ef","observation_id":"4831dc82-f64c-4e00-b32f-f9a6d6545e57","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 34th International Conference on Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:6c007dd9d3228af8fdbb19407e431e229603ced4f4ffe99a537aa25c3d277274","observation_id":"e25ba11a-4ae1-448c-8a58-e4a6bd9a45a6","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:9b689c72045a9dc03f67ae1be4b594503ce06b587cb61251a412396efd22b13e","observation_id":"35b7ee3d-265d-49be-8304-c112ed447fc2","resolution":{"observed_at":"2026-07-03T09:17:48.969922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:07.78032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:07.78032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Preference Transformer: Modeling Human Preferences using Transformers for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:e27b72f9c6e5984f2e91f9734201d6fa30e2848d395aa26a9e2eb0b842ce7298","observation_id":"a724ca4a-cb26-4ac3-8886-9510f09ae5ad","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Nature , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:3e00d5964b2bdb3ba879a8a3bf9585d03252a33523fd72fe77fae426d0b4736c","observation_id":"7d18e2af-bedd-40c2-9a08-e4624264b690","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:6ab90fb6cb859d34c49938f93a12cf092e96fa758f25434ad6d3497b99649dee","observation_id":"8ebc35ec-39f2-4c8a-a342-6552218ff125","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Transactions on Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:f73e898b42eed8f1e8b39896e06a9913c362b3b56152b7345fe3c26a4dc8ef4e","observation_id":"71a12045-9e9d-4d8d-839e-502f0440374d","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:dacadbddbe24109d59a0ca60d3fb7c629a6737a010e4aa0e6961bfdb14ad35f4","observation_id":"759c58c9-a30f-48cd-b900-5d437f58e889","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Journal of Machine Learning Research , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:66f5e6b4beefa8793f000cee7495b3c2e44bc5f23a0f8c1f7b9b0ba5742e80d9","observation_id":"387a86f7-d6d1-4b1e-8e23-29172935bc09","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:ddc9d6069b124e01e018d0092a9bb87b9e0de6f674aeb8c8c17eed5960af5524","observation_id":"2488a7e6-b8c0-4946-9667-ed294de75967","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":"2006.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-08T22:35:40.693821Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","venue":"cs.LG","work_id":"f0a11265-1acf-4ffc-a822-08bd04b6bddf","year":2020},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:4bef3483a1ac23cba5aa0a712e0465631923296b87a125699d4e15dfe8562cfb","observation_id":"c075e239-4c6f-4c99-930a-4b47c27ad302","resolution":{"observed_at":"2026-07-03T09:17:48.975707Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"2004 , publisher =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:5935610836738f844a0ee8f36ff2f6661ca5fef2edca5d999c9ac0df0ef37848","observation_id":"6f985021-32f5-467e-9c9f-8a712afeae4b","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:c52db24039a87ea8c84b6d5b3ff65861e8e2f7ea5031a1881182f75c5afa1a1f","observation_id":"b2b6cb4c-3ff6-41ff-99b5-dfa8b583a97a","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 24th international conference on Machine learning , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:0b98a52115ba873e756a05cf4944952bb50a1f7759aef919af299355b140b7e9","observation_id":"99ea51cf-6111-41b4-af8d-121fc4af3347","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:4bf684d4de5306bedf5b5d8f4dcaa3d4905779979e27591806dd79618968cd5d","observation_id":"6c02fddf-0003-4e30-8a2b-060bba30961f","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:b636b6a08cd2acf5c5bad5135b867c996201484b1cf1eef6e173a1f82f06a9df","observation_id":"8187606f-c1de-4073-b985-5ac91cc39c33","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:e92efa4cda84619dd78a22b5845f4dd5c65954f87acd0e81ab1c1ec0b43e3b64","observation_id":"8c2fc8d0-a141-40cf-b0ed-0aba6604c8ac","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:c5c97c176e7967826764af3c0d1e33276ce9ff82cd69971a22dc9061e55e24ce","observation_id":"ab89b561-5bbf-4629-93f7-932e89aab344","resolution":{"observed_at":"2026-07-03T09:17:48.984384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:c835b43dc06047791c51407bf97805dc7a02bf7f104c0f9e37c1b00b63208abf","observation_id":"ce49d7a1-5390-4592-9480-e559ae6bb3ec","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":"2110.06169","doi":"10.48550/arxiv.2110.06169","metadata_source":"pith","pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":"cs.LG","work_id":"4adca4ff-8975-49b3-aee4-2ef7e0f95275","year":2021},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:8c56916af98603553bc83febd4d672d89ee7c4e826883e207195174d6a616196","observation_id":"673d7464-3f29-42d2-9c1d-d077a980f23a","resolution":{"observed_at":"2026-07-03T09:17:48.981147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 32nd International Conference on Machine Learning (ICML) , series =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:d0b11b88d4ef8bfa1007123e5fb374a92d6d652787caba6cc3bdc02583d1b560","observation_id":"53003653-8543-4981-9322-398fd386453d","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:d3d1a63314575ee72b17c70baae42cb220ca79871356a57fe9ca0528302ffa85","observation_id":"7cf078c1-3899-4263-b9d8-4f1119ad30d3","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"The Thirteenth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:2d78c716a414a17d41d1defc8c278e4edc8087a4bb9582702ac9220921c3112c","observation_id":"12a8510f-96ac-4e62-bac9-994096632e37","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Geometry-aware","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:a0fbfdc8fb2c79b535b7d1e789262e56373d3c822c6fd2cd05546782075d208f","observation_id":"5b2483c5-49d6-4d52-8f3b-8313b07552bc","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:1f4632058b1303d5521a333e6cc1563eb02184738e609ba076b87498176fff1c","observation_id":"7926bc03-cc69-4fd8-bd52-469cd1f61460","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Cognition , volume =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:b3732c9bf164594f714855d55a34584d8adb5349231567e7862b2d1990ffd682","observation_id":"db7cc7be-7a40-41c2-89df-7cff68283aad","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Unpacking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:0d1859b29511839df9d3a73932e3592fb1db1aa1110420e302801a8f64ff1fe0","observation_id":"5e426a98-0132-45a8-9aa1-6a8e552c89cd","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:5950dad3fd458ca97398ae7ac1a6292893bb30df0204407c8407fbbfd7064ba5","observation_id":"c7357dd1-5ff0-48df-88c0-a1d5e3e3a445","resolution":{"observed_at":"2026-07-03T09:17:48.960992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":", author =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:b470bf9b4f4e9f81639661bce2303d7bfb40de64c7bbbae25858f63f183ed56f","observation_id":"056e8dba-613d-4a65-89ce-75b125ea3084","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:f575033e226595be62022493c5bac3dea5f5eb066bf8d1362dc182df6cf7454d","observation_id":"09ffdec8-675f-4f96-ab13-80897eae2717","resolution":{"observed_at":"2026-07-03T09:17:48.966800Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:c4e5d02532b5a8bb2739b5a21d0c1d1a67d6ffc6150ba393f9de11ba7ec49922","observation_id":"0963e057-5475-4b0d-adb5-5a2443c8d4cb","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13683","last_updated":"2025-03-11T00:54:05Z","snapshot_observed_at":"2026-08-16T13:16:47.408064Z","submitted_at":"2024-09-20T17:51:24Z","title":"PrefMMT: Modeling Human Preferences in Preference-based Reinforcement Learning with Multimodal Transformers","version":2},"cited_work":{"arxiv_id":"2409.13683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.13683","snapshot_observed_at":"2026-07-03T09:17:48.985713Z","title":"arXiv preprint arXiv:2409.13683 , year =","venue":null,"work_id":"815b850c-e167-4c51-87cc-6bbeefae39f2","year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2409.13683","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:297d4061eae73596cbe0a6083d87d0e6931a5ea18771b5c247895f36b190310c","observation_id":"f1da0604-1bad-4f25-830f-1d830c41d841","resolution":{"observed_at":"2026-07-03T09:17:48.987098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Conference on Robot Learning , pages =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:fabec5899052716c1597a1b4405a7a89ad2acdb869790cb8ef70ac14e24777fc","observation_id":"796622d1-726c-4be5-b4af-f50028da8735","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in Neural Information Processing Systems , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:b6e06b0c56542cb2caad2376bca76885150f8958c6cb426f34247712889bbfec","observation_id":"7c66c414-a776-453a-9791-69222fe46006","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 42nd International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:f54e6a8f90051f793abf94ed10883b5d4a17ba1471bf11c9717f2825d840ea3e","observation_id":"24d8777b-2872-44cb-bd3a-1c172fdfd41a","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 35th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:516e35a8668c02f45a23c43a892ff7b30146326fea0f521161b33b3aac7884df","observation_id":"d4813d80-7682-453b-8c61-3acbd711132e","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:4687f1b5cbd2c2d7870766d5a7e787834a1404ac5369aacf7b11bd3806585dc5","observation_id":"dcf002a9-21a6-4b5e-a84f-6b817871b6dc","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"The International Journal of Robotics Research (IJRR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:301dfcc311d4c8bd565c11f81b9c857afafd70d5770e49aad22ce4520faee834","observation_id":"389884a8-fdd4-4660-9e32-6a4725cc65fb","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:58efe52698f7a6549fd71bef93245c6b9c9c26747f94c5c11facca9e88236468","observation_id":"1c9989d8-98b0-48f5-9343-3d091a86a571","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Proceedings of the 5th Conference on Robot Learning (CoRL) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:3021451c2eff393e1f105a89b18a0583b95ce63750ec3febdb6fa658ac4b02cc","observation_id":"6617a897-b56a-4ecf-adb3-9138e82fb0e4","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:dc503e127d7dfcebcd240c8e75b1f44641afcfbb0fac01a3f184341944b9435b","observation_id":"403f6093-e0a5-4c50-8e04-15184842f8c9","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"36th Conference on Neural Information Processing Systems (NeurIPS 2023) , year =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:71be76cf9538247536565d9a0d063739301cc8e0da9c360ce9c5b82e97463079","observation_id":"394cd866-b3cd-43e6-aebc-084317dd8c1f","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04451","last_updated":"2024-07-05T12:05:37Z","snapshot_observed_at":"2026-08-16T13:36:48.713710Z","submitted_at":"2024-07-05T12:05:37Z","title":"Hindsight Preference Learning for Offline Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2407.04451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04451","snapshot_observed_at":"2026-07-03T09:17:48.968462Z","title":"arXiv preprint arXiv:2407.04451 , year =","venue":null,"work_id":"49b1e7a3-e682-44fe-bd10-5d2107c89686","year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2407.04451","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:cc3e9b0675976576a98619fefd54e9c71d011fbe2edf92a8db1d9c0778d110f3","observation_id":"6fc2c42e-d082-47cc-a619-c40609c58885","resolution":{"observed_at":"2026-07-03T09:17:48.969947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"Hindsight","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:ec81318ce47c97eed40dc7c5593520f75a357e1e64b71603a8ac52f6bdceb16e","observation_id":"bd3f97f4-8a3d-4046-b2c4-5db675e327f2","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:68290d6703e25370c948f571361b29dfc35da808f96ab6bc9e8062e8122e3463","observation_id":"b7600c51-df48-4708-a5bc-6ac7526c8d90","resolution":{"observed_at":"2026-07-03T09:17:48.973238Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International conference on machine learning , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:8069489fdb977ac6d790ad3e7659944a0d70a25b2e501ac94bf4ca657e6d575f","observation_id":"415bd8f8-095c-4ed6-a19e-34e86c11b3d5","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:7201c7eb15847e85ef6a3c8d4dd8ff5ea2e68f32be56d214d31631f427a55b78","observation_id":"550b1134-1d44-4a02-9403-244724cbaa8f","resolution":{"observed_at":"2026-07-03T09:17:48.979072Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:22:51.007376Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T10:22:51.007376Z"},"links":{"citing_paper":"/paper/2606.11982"},"observation_digest":"sha256:e6c8060756000cfe72ec900dc833dfd72bfdb28f1f0e4deddde261cb749c6b66","observation_id":"c0e84feb-61ad-49ae-ae90-2db57d827e05","resolution":{"observed_at":"2026-06-27T10:22:51.007376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.11982","last_updated":"2026-06-10T12:00:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T07:08:01.332844Z","submitted_at":"2026-06-10T12:00:17Z","title":"PAWS: Preference Learning with Advantage-Weighted Segments"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2606.11982."}