{"as_of":"2026-08-13T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44f26eb19fd41cfd7e1796b70c751cb08e9d7cb28d7adf2e7569b158f11834dd","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:16:43.217090Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T03:41:52.859647Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T03:45:17.571390Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"cited_work":{"arxiv_id":"2506.08681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08681","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating reward over-optimization in direct alignment algorithms with importance sampling","venue":null,"work_id":"89cf9ee3-8638-44d0-a88a-a84f29518323","year":2025},"citing_paper":{"arxiv_id":"2605.23398","last_updated":"2026-05-22T09:11:20Z","snapshot_observed_at":"2026-08-12T23:04:07.072084Z","submitted_at":"2026-05-22T09:11:20Z","title":"TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T03:41:52.859647Z"},"links":{"cited_paper":"/paper/2506.08681","citing_paper":"/paper/2605.23398"},"observation_digest":"sha256:b20ea0509cc7dc69a9d30b446b253fab5abdb9392357cf519b8fc6cdabcc3054","observation_id":"e1f65f80-3589-45c1-a711-d6626b6e7187","resolution":{"observed_at":"2026-05-25T03:45:17.573771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08681/citation-record","integrity":"/paper/2506.08681/integrity","json":"/paper/2506.08681/citation-record.json","paper":"/paper/2506.08681"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-07T05:16:43.181106Z","title":"12 Preprint Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.181106Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:282e11465518f8162b81a8d6fade7f48b2c4e59bae8b323fab00b03680f91cd1","observation_id":"a0f685e8-a465-468b-a58f-4832787db942","resolution":{"observed_at":"2026-08-07T05:16:43.181106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-13T04:24:21.093265Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T05:16:43.185377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.185377Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:c2869e1c9e6c563ed2f56590539ed782d76c601cf50411d38925d3afa95a35f6","observation_id":"258e424f-f7ff-40c9-a1f4-26cfa3be0f3d","resolution":{"observed_at":"2026-08-07T05:16:43.185377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-13T04:24:21.093265Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T05:16:43.189540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.189540Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:53c1f9aee798f2db41df7e1e5d9d5d6c3d0f7f0a9940d07b5c4bd4650fca825a","observation_id":"4d66ed61-f61e-490b-ae51-adb4cca2b999","resolution":{"observed_at":"2026-08-07T05:16:43.189540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T05:16:43.197365Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.197365Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:702b7ef218fd65bc354027a2a16e2388d1d66a1db7c485a69ed7d2623d61a2df","observation_id":"2ecd451f-e590-4233-8ca6-48f70ef5035f","resolution":{"observed_at":"2026-08-07T05:16:43.197365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.374498Z","title":null,"venue":null,"work_id":"9ba07b25-1d88-40d9-a8d4-9ac7729a1d3f","year":2022},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.201513Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:656dae932f949251245990fe6dba623994a22d88ba7286cb7636cf448bcb67e4","observation_id":"f2f2f166-723e-4ae7-9a6c-85d85b5b8c91","resolution":{"observed_at":"2026-08-07T05:16:43.378995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:16:43.209489Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.209489Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:c604fcbef3c37119bae7b544fd7bc2ec5b2881c24adbbea77076fc5e8259afb3","observation_id":"847a3684-3bc7-45c9-9457-2fc086b44a42","resolution":{"observed_at":"2026-08-07T05:16:43.209489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.349280Z","title":null,"venue":null,"work_id":"a8101aca-f21f-4977-8226-35cd9e54d823","year":2020},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.213207Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:e7e9205b5014940d6f7b70341c3f12c98fa58662e214bcaffdc5730bf8ee949d","observation_id":"b43310e1-adb9-47f2-ba3b-74fa4eb505fe","resolution":{"observed_at":"2026-08-07T05:16:43.353429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.334370Z","title":"gpt-4o-mini","venue":null,"work_id":"e3f01963-b40b-4895-8ae6-40ae87ee70ca","year":2022},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":640,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.217090Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:cac337faf5e9674f2e0819f066a564b5231c214e3b51dc6fac329db46caebc0c","observation_id":"9c79d974-d0d4-4636-9e46-2afef4379b97","resolution":{"observed_at":"2026-08-07T05:16:43.340209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.400268Z","title":"cc/paper_files/paper/2017/file/d5e2c0adad503c91f91df240d0cd4e49-Paper.pdf","venue":null,"work_id":"5947257c-4a78-4ff8-aae8-3913bc6c7919","year":2017},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.171719Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:2e2dbad7ec1b0792b5c027c9f227d6571f8ac807c43834f69cc3e7bce1ba0f3d","observation_id":"6c2a0880-c598-4a3f-b7f5-1f9f2cf431ed","resolution":{"observed_at":"2026-08-07T05:16:43.405220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.387218Z","title":null,"venue":null,"work_id":"013e030d-cb31-4fa3-914a-63226d04e2b4","year":2020},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.193528Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:d3bac5aefc0fb42d39dbad65a815d6c229ba4b44a566f898dba6fa2b5063d639","observation_id":"a77382f5-edcc-4ce8-af9b-2e9f9ac1bef2","resolution":{"observed_at":"2026-08-07T05:16:43.391070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.176803Z","title":"doi.org/10.1002/9781118445112.stat08284","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.176803Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:9d43b84af56b9692c1ec77a7ab69834a34972bc1980558c11b2af16c65effb78","observation_id":"220cbbf9-df1c-41a9-9a11-0e648098282f","resolution":{"observed_at":"2026-08-07T05:16:43.176803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:16:43.162886Z","title":"2204.05862","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.162886Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:87efbcc497ee26e4c09c742da90479c4ed0f9680828e0f67e32bc11768847598","observation_id":"a041404c-0989-4b13-b3a2-30e20740b42a","resolution":{"observed_at":"2026-08-07T05:16:43.162886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.361890Z","title":null,"venue":null,"work_id":"73de23bd-4129-4a0d-8d22-8e83145af579","year":2024},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.205323Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:8a6f7268f087565a66a5ef84dffcec9b8984653ee6ec3d70bd7e449fbda4d034","observation_id":"4a290447-6663-444f-9ffa-cd2c74a00af0","resolution":{"observed_at":"2026-08-07T05:16:43.365925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:16:43.157955Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.157955Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:c099293f74d366b58ea6bc2e68758f63660029ceaa9d1264dee9eb3ec42149be","observation_id":"e92b9e93-09fb-4fc7-a05a-db9669aceec6","resolution":{"observed_at":"2026-08-07T05:16:43.157955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:16:43.413296Z","title":null,"venue":null,"work_id":"2d61be8e-312a-4b85-a3f1-1415027a1222","year":2024},"citing_paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:16:43.167292Z"},"links":{"citing_paper":"/paper/2506.08681"},"observation_digest":"sha256:b00aafa4d41ff3ca3638c2d0e0c90d657f9ddfb4f81eeaafa94854e93bb0c6d9","observation_id":"d41e3211-0888-4820-835d-ee00b26f148a","resolution":{"observed_at":"2026-08-07T05:16:43.418032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08681","last_updated":"2025-06-11T06:36:33Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:55:27.783916Z","submitted_at":"2025-06-10T10:45:26Z","title":"Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2506.08681."}