{"as_of":"2026-08-09T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7ce0edbc04c28ac21c4c7d8f73c84c49e6c1ae49d3258cdb1e7347e3e60427e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:33:51.144721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T11:54:38.395848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:04.779597Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2504.20571"},"observation_digest":"sha256:6f4729ff3dc8c6a2e8e3d43021cae49da1d6e8d90c413a01b2d65a7002cfdfb6","observation_id":"3c1a0ce5-1a1c-4302-ad9c-3deb7fd487ab","resolution":{"observed_at":"2026-05-15T19:51:05.040421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-07T15:33:51.144721Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14826","last_updated":"2025-05-20T18:41:34Z","snapshot_observed_at":"2026-08-09T02:47:54.126071Z","submitted_at":"2025-05-20T18:41:34Z","title":"FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:33:51.144721Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2505.14826"},"observation_digest":"sha256:7847fadfd1fb1e1df63f428b61c2b585cd6b1df5931185bbb8251592a5c6a027","observation_id":"fc84104b-b3ff-4fd6-aee8-135c2a4557f2","resolution":{"observed_at":"2026-08-07T15:33:51.144721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-07T14:10:40.442509Z","title":"Provably sample efficient rlhf via active preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20268","last_updated":"2025-07-24T14:21:12Z","snapshot_observed_at":"2026-08-08T15:11:42.219804Z","submitted_at":"2025-05-26T17:44:08Z","title":"Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:40.442509Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2505.20268"},"observation_digest":"sha256:723bce0c6e339dd3bbf6427a8e3f5ca56155a9b75a59a73781585c31655d1b34","observation_id":"4b56a1c6-51ce-444d-85c0-4266939f0d2e","resolution":{"observed_at":"2026-08-07T14:10:40.442509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-07T11:33:53.628034Z","title":"Active preference optimization for sample efficient rlhf.arXiv preprint arXiv:2402.10500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.628034Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:27bce4e8fca63674673d5e72a1f47124583ca6199fdc156b39a6ca1b305557e4","observation_id":"5182579f-4527-4fea-820f-fafc04ade777","resolution":{"observed_at":"2026-08-07T11:33:53.628034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-06T14:13:06.584028Z","title":"Active preference optimization for sample efficient rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:06.584028Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:8e049e50ef1b87fea08b18104745521d9d4d6be516a0ec02cd403e2330024947","observation_id":"0eed8347-9013-4e61-8a8c-85cc4566353c","resolution":{"observed_at":"2026-08-06T14:13:06.584028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2602.03452","last_updated":"2026-05-06T05:26:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-03T12:17:25Z","title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:50.793194Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2602.03452"},"observation_digest":"sha256:707c463a4252d0f8bc7b97dee99624dd07b698ad1d58f2d5b2dca479fcde8310","observation_id":"127f23ca-70cb-44e5-bfda-4e82a1ee6d50","resolution":{"observed_at":"2026-05-16T08:27:36.833890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:7b4a7cff8ba02980ba491d5ed3346d58973559c8df0ed09228ca64131e5c77b6","observation_id":"83ad6cf0-5e9d-4a37-9fac-fa443207e2d3","resolution":{"observed_at":"2026-05-16T06:37:28.542340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:30bd47c4f84c0f009d8a2a9bf0acc850fd87b391b0c9cb18a37ac24354652d01","observation_id":"654d8ec1-75c3-4deb-af72-177b3e5c065e","resolution":{"observed_at":"2026-05-21T13:10:10.420023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2604.02507","last_updated":"2026-04-02T21:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T21:04:17Z","title":"Reinforcement Learning from Human Feedback: A Statistical Perspective","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T20:10:43.578904Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2604.02507"},"observation_digest":"sha256:98c325e47d7609c10b205f96de1267f3268865c32b38e556a3af2c66d12a11fe","observation_id":"d63cda43-1747-4513-9716-71d4a312e267","resolution":{"observed_at":"2026-05-13T20:13:13.649261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2605.00155","last_updated":"2026-07-09T02:28:34Z","snapshot_observed_at":"2026-07-12T23:17:30.599444Z","submitted_at":"2026-04-30T19:22:56Z","title":"Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T21:03:53.045304Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2605.00155"},"observation_digest":"sha256:2f543037a28857101f9a404c9436d13d5d82af07cade11fd08f4f126469fc01a","observation_id":"e6b22369-3ace-4ff6-bdc8-ca9414f4c7a2","resolution":{"observed_at":"2026-05-11T14:46:45.870405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2605.10784","last_updated":"2026-05-11T16:18:08Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:18:08Z","title":"MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:37.374346Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2605.10784"},"observation_digest":"sha256:72fe8840cde5c0f909ec6f5b1b726b1c5324a2f507d3d6463ee388e13f371b16","observation_id":"650112f8-d2a3-42a5-aa76-307741b3e8eb","resolution":{"observed_at":"2026-05-12T06:31:24.543726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2605.20408","last_updated":"2026-05-19T19:04:47Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:04:47Z","title":"Spectral Souping: A Unified Framework for Online Preference Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:56.356555Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2605.20408"},"observation_digest":"sha256:c75f99549b405160aa22bb09d8396163f71444173137db922f14b7f825d26576","observation_id":"c01721f9-e770-48ed-b2e5-f67d73a59e35","resolution":{"observed_at":"2026-05-21T07:59:50.957942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":"2402.10500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-06-30T11:54:38.395848Z","title":"Active preference optimiza- tion for sample efficient rlhf.arXiv preprint arXiv:2402.10500","venue":null,"work_id":"4b2ecec4-95fa-4a02-9a9f-6310eb828c95","year":2024},"citing_paper":{"arxiv_id":"2605.24803","last_updated":"2026-05-24T01:25:09Z","snapshot_observed_at":"2026-08-02T21:29:41.818246Z","submitted_at":"2026-05-24T01:25:09Z","title":"Active Learning for Stochastic Contextual Linear Bandits","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T11:49:35.327709Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2605.24803"},"observation_digest":"sha256:cf4bbd759dfebddf0b94a05eafa532272170efcb6a84fc4d4a4a1d01b85accf1","observation_id":"91328711-5186-447a-aa88-0448c01b8788","resolution":{"observed_at":"2026-06-30T11:54:38.397551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.10500/citation-record","integrity":"/paper/2402.10500/integrity","json":"/paper/2402.10500/citation-record.json","paper":"/paper/2402.10500"},"outbound":[],"paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T07:38:45.952080Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2402.10500."}