{"as_of":"2026-08-10T20:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8a947f42702b1a48ced6a98c8be1d4577dd2e182cbdc0d0c8203a750303a491","coverage":[{"denominator":8,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:29:44.180267Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:58:53.430492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-10T14:00:28.429589Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"cited_work":{"arxiv_id":"2601.02986","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.02986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","venue":"cs.CL","work_id":"6a788620-3ba4-4e54-b7e2-1550fea02382","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2601.02986","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:f37a2a397630cc97b2c239694558a5d0199e20523cd7567c5c36bd533a5b8d1f","observation_id":"2e14b05e-f5bf-4458-ab3e-8169f130eb29","resolution":{"observed_at":"2026-05-10T14:00:28.432183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.02986/citation-record","integrity":"/paper/2601.02986/integrity","json":"/paper/2601.02986/citation-record.json","paper":"/paper/2601.02986"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:29:44.124830Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:44.124830Z"},"links":{"citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:6affa34b2cd38b6d6ecd4bfcabe3c167ed310b960d413c8e08f25ed09f88ec04","observation_id":"d251bfe8-e455-4f79-8f50-b301e2fcc9b7","resolution":{"observed_at":"2026-08-03T12:29:44.124830Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:29:44.180267Z","title":"Use the checklist as feedback: incorporate relevant criteria while preserving correct and helpful content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:44.180267Z"},"links":{"citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:d332cad04ca04dd199bcf7682a528ed2fcbe4b4f03bfa7ea43a01aa704cec43f","observation_id":"241219b3-cab4-4018-924b-1d4a01c8c11f","resolution":{"observed_at":"2026-08-03T12:29:44.180267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19229","last_updated":"2025-08-27T17:17:02Z","snapshot_observed_at":"2026-08-05T15:45:14.590882Z","submitted_at":"2025-08-26T17:45:05Z","title":"StepWiser: Stepwise Generative Judges for Wiser Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19229","snapshot_observed_at":"2026-08-03T12:29:43.974215Z","title":"InProceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 23142– 23172, Vienna, Austria","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:43.974215Z"},"links":{"cited_paper":"/paper/2508.19229","citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:809d058556b42b7a70466616f87249d4992f86252951551c040870cf52823adb","observation_id":"7c94dc5b-54a7-489e-9f51-e93e7a6c470a","resolution":{"observed_at":"2026-08-03T12:29:43.974215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-03T12:29:44.062804Z","title":"prototypical preference points","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:44.062804Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:91b96d4e40042964942cb26a396ad128a58c508de8b10d7388afadc591ee9be7","observation_id":"2ddb89cf-e45f-4530-9a3b-1dea7a706d62","resolution":{"observed_at":"2026-08-03T12:29:44.062804Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:29:43.686297Z","title":"Anisha Gunjal, Anthony Wang, Elaine Lau, Vaskar Nath, Yunzhong He, Bing Liu, and Sean Hendryx","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:43.686297Z"},"links":{"citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:31c155be5c82dae14b8ba850190d56b102d0c063f274a3d0fd9859e5c183b146","observation_id":"d6a81e8f-f4af-48cb-860e-13fef9e080e3","resolution":{"observed_at":"2026-08-03T12:29:43.686297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11564","last_updated":"2023-10-17T20:22:13Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T20:22:13Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11564","snapshot_observed_at":"2026-08-03T12:29:43.847480Z","title":"Hyunseo Kim, Sangam Lee, Kwangwook Seo, and Dongha Lee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:43.847480Z"},"links":{"cited_paper":"/paper/2310.11564","citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:59539c589d7f7fd2f0dd80c46a10aa339aee2a95539eb79a114779bedd0ceb63","observation_id":"92c0a982-70b6-4323-94a8-1cc5954d08a9","resolution":{"observed_at":"2026-08-03T12:29:43.847480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T12:29:43.908771Z","title":"InThe Thirty- eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:43.908771Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:eb9f1c2c96ef980e62260ed25b008c5e471ded21f2e86fb8fac97903074018fd","observation_id":"e32ca7d8-4c0b-4a10-93a1-8148a62a2950","resolution":{"observed_at":"2026-08-03T12:29:43.908771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-03T12:29:43.786052Z","title":"Chrisopher K Hsee, George F Loewenstein, Sally Blount, and Max H Bazerman","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:43.786052Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:05506b09b466623f05a59f69e2c187051930a201955c9fa91ddb977c7d62cc50","observation_id":"a747276c-e1b0-41d0-81a2-c2a8913f7025","resolution":{"observed_at":"2026-08-03T12:29:43.786052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T15:19:28.521431Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist"},"reference_resolution":{"displayed":8,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":6,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":8},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 8 of 8 outbound references and 1 inbound Pith citation observation for arXiv:2601.02986."}