{"as_of":"2026-08-22T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3832f5aec5a33c269c8c1a060d23538e6db32ac4c45b4c3999eaeee24b800f8c","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:55:19.365804Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:52:06.705135Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.705912Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-08-16T00:52:06.705135Z","title":"arXiv preprint arXiv:2506.15651 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02666","last_updated":"2025-08-29T15:47:44Z","snapshot_observed_at":"2026-08-18T19:51:24.628281Z","submitted_at":"2025-05-05T14:15:02Z","title":"A Survey on Progress in LLM Alignment from the Perspective of Reward Design","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:52:06.705135Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2505.02666"},"observation_digest":"sha256:ebad3a352ee99c9b9ac81dc279d9d322afa5ff4c80b1c7612539b13b6c62c29e","observation_id":"ce1cbc83-1f7a-418a-9f3a-c78c75413aaf","resolution":{"observed_at":"2026-08-16T00:52:06.705135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":262,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:467b5a13f6e52732dd29f6d14b2849e896e5b461e0f41e9ee2d48a1e3ba7cc9b","observation_id":"eb9dc29b-af21-4a33-837f-297378dc94bc","resolution":{"observed_at":"2026-05-14T22:23:15.294691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-08-04T16:07:42.225595Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:42.225595Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:361464a6df2c6c03c9a881dc691f33d932ff8d0420ab744ead49ea63a567aace","observation_id":"ada27720-584f-40ab-a0a2-a0c9f39baa49","resolution":{"observed_at":"2026-08-04T16:07:42.225595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2604.18131","last_updated":"2026-04-20T11:54:20Z","snapshot_observed_at":"2026-08-14T06:23:01.737989Z","submitted_at":"2026-04-20T11:54:20Z","title":"Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T04:36:27.381942Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2604.18131"},"observation_digest":"sha256:4e239aa017de024d502bff28d9c1349a7b5364c373d9f3f863e04e0405d1b140","observation_id":"0ca00ec7-4d2a-4e55-9fcd-e12388adae42","resolution":{"observed_at":"2026-05-10T12:10:23.451741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2604.19341","last_updated":"2026-04-21T11:24:09Z","snapshot_observed_at":"2026-08-13T08:23:53.899364Z","submitted_at":"2026-04-21T11:24:09Z","title":"Evaluation-driven Scaling for Scientific Discovery","version":1},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-10T03:39:52.204043Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2604.19341"},"observation_digest":"sha256:ed88d1616c655903384fbca1b88086f74e921fb289c50722349639ffa0cde58d","observation_id":"bfb0290e-40fb-4bfc-a48a-58a088745556","resolution":{"observed_at":"2026-05-11T12:26:05.330212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T12:11:23.775843Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:1fb36f22781717c97975930b0443ba260a14295a01ddaae8adbf53c29d8202f2","observation_id":"abdb9b9b-5c93-48c9-94f5-4a5ab4fc5248","resolution":{"observed_at":"2026-05-20T12:13:16.112770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:19:39.848194Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:013b74ef0b4888e8604b57f5b915dc28452b25e79dec200d98929330d16f9cf5","observation_id":"cee7903f-9cbe-4bc3-b9c4-dbedb0d01671","resolution":{"observed_at":"2026-05-22T09:21:21.439793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2605.30568","last_updated":"2026-05-28T20:59:45Z","snapshot_observed_at":"2026-08-21T02:12:14.030428Z","submitted_at":"2026-05-28T20:59:45Z","title":"Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:21:37.937934Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2605.30568"},"observation_digest":"sha256:ab70a973ee998b5cbc4a83b7adee1a41c5c5046daa56a261507740e3953bddd7","observation_id":"e2dc734c-b2b6-479d-9a4c-e9bd28f1bad1","resolution":{"observed_at":"2026-06-29T07:23:12.618105Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:a5786773f2c443a4e7f2302e6ae4cce99f0ecf129deae2a0fb9cb77a51c1bc98","observation_id":"2107dac5-c1d6-48f2-8801-6c2dd0e50e20","resolution":{"observed_at":"2026-07-04T08:09:40.707284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15651/citation-record","integrity":"/paper/2506.15651/integrity","json":"/paper/2506.15651/citation-record.json","paper":"/paper/2506.15651"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.720774Z","title":"The claude 3 model family: Opus, sonnet, haiku, 2024","venue":null,"work_id":"3306a2c0-f318-4c35-8e80-acaec784d959","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.078806Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:0393c9aecc00a39193b8e5f151d0419a41377adfdacef945564ea8ea9eb734d2","observation_id":"5d924e4a-6e1c-4a66-a136-cfe0b695ed8a","resolution":{"observed_at":"2026-08-06T23:55:23.878456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.592052Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback,","venue":null,"work_id":"b2d45f56-44a4-40b5-b96c-9a7e3a7df47b","year":null},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.146217Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:d7f044086bf1e70e3d52af758f284b5dd7d272ed94d50d6bb11d25bd39e74954","observation_id":"6c02a401-4af8-4245-ac7f-1578f504b921","resolution":{"observed_at":"2026-08-06T23:55:23.627779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T23:55:16.515092Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.515092Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:cb1b718f69d45f06057ceb695a932a4746363a257df7678ecb64852ef5bcf400","observation_id":"d409543e-9789-4a80-a823-91960e13630e","resolution":{"observed_at":"2026-08-06T23:55:16.515092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.376698Z","title":"Odin: disentangled reward mitigates hacking in rlhf","venue":null,"work_id":"1c2b3261-42f6-45e5-9494-555659c52b36","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.653707Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:700c62e4f71cc7aee9c4efb41e0ceceafeae338bd8825ee9ee5662e45daea6f7","observation_id":"bf3ebc87-f99e-47ec-bca2-45f2ea52e711","resolution":{"observed_at":"2026-08-06T23:55:23.516900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.098759Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2024","venue":null,"work_id":"61d005bc-6b42-4aab-bda7-5bb4a48be5df","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.808290Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:36b72942b315778cf6f9e8b6586ec0c5ec41e9327e47978493eaf4b07b86cbb4","observation_id":"8e933ef1-de09-41c8-b638-2b2aa1613da6","resolution":{"observed_at":"2026-08-06T23:55:23.220705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:55:16.919221Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.919221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:dd92e34b436db153e1edac6520c7bee20d59b30d9a23d428e9f9d0d54a4bc6de","observation_id":"dc5c5bfc-8105-49c2-a982-d9c7d62efdea","resolution":{"observed_at":"2026-08-06T23:55:16.919221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:22.797444Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators","venue":null,"work_id":"a0722879-e502-4cb3-86bb-5f418b92ccf0","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.098160Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:1e88cfa01682cdb1fc75ff74c745c31c748cfc8eb6997622b0c07357b0221e66","observation_id":"6c38fd67-dc42-46cd-b62f-8d1ad1879e81","resolution":{"observed_at":"2026-08-06T23:55:22.952432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:17.220976Z","title":"Reward shaping to mitigate reward hacking in rlhf, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.220976Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:834d3a202f1596293b13ef98bcfdb80c284500cf2d6889a7cae4fccbf95678bf","observation_id":"1632e14a-4c0e-4f8b-a419-19fc043d74dc","resolution":{"observed_at":"2026-08-06T23:55:17.220976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:22.561550Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"29b2ae9a-4524-450a-9847-e089aef130c3","year":2023},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.370411Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:911f32536f1233f68fe9062008ad34d24b544d3466819a38d3f484b61e573ce0","observation_id":"a17db659-2111-4ca2-a188-08f38718066a","resolution":{"observed_at":"2026-08-06T23:55:22.687833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:22.283636Z","title":"S., Green, R., Mokrá, S., Fernando, N., Wu, B., Foley, R., Young, S., Gabriel, I., Isaac, W., Mellor, J., Hassabis, D., Kavukcuoglu, K., Hendricks, L","venue":null,"work_id":"22c46d02-4ffd-408b-868a-058d4a34bce4","year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.475196Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:bad88b0e80221146d2ad3216c08c6d975010d3f188724284339f00138f584951","observation_id":"3b3496ff-6536-4ee3-8b78-27e842cb7a96","resolution":{"observed_at":"2026-08-06T23:55:22.395484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:55:17.559872Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.559872Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:22f87522b3653d95bbcc3791fd33aaafb2f50da6bfb5152f07054887e95bc334","observation_id":"33486952-d28f-4202-89ff-01085059ccad","resolution":{"observed_at":"2026-08-06T23:55:17.559872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.938215Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework, 2024","venue":null,"work_id":"a2fc7ac8-df33-40a5-9b91-7003b933fd62","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.694338Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:5b0d3415aca2615d01040d05cd1436ffd90824559433cc621d37bda4c3dc78cc","observation_id":"e46063c1-7856-4808-89d6-2be2185331d0","resolution":{"observed_at":"2026-08-06T23:55:22.089056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:55:17.770085Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.770085Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:6d796e21986b5b9f3af6abf08aea860a41150cec5497cb6064b804b2455d3b05","observation_id":"2c941af4-2b1b-46cc-81cb-7852c8327d7c","resolution":{"observed_at":"2026-08-06T23:55:17.770085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.636847Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":"d5f618dd-1963-414b-b99f-8f6e26a4e5e2","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.841397Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:cb8874e1bf085b413316980db2521ec045b7bc3e1bd64ef4eda5cc6f33a25415","observation_id":"168800b7-45b3-482e-883a-7fb8975cd15d","resolution":{"observed_at":"2026-08-06T23:55:21.776544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.298846Z","title":"Rule based rewards for language model safety","venue":null,"work_id":"1a51536c-ff6d-4995-9c9a-339e69a45dab","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.907897Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:08adfab401550f5a2c2a0fda094661eb360b18213f8d958d11abd93b46f14f4b","observation_id":"96037b73-3393-4f8f-9b99-617ffb2e20f2","resolution":{"observed_at":"2026-08-06T23:55:21.471082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:55:18.001414Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.001414Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:5b4f8252d9ed81c972fd9340e9882e3296c2efcfb3e97258b17f75d71c84d72b","observation_id":"3be88102-f3ab-457f-a736-06037b856f0e","resolution":{"observed_at":"2026-08-06T23:55:18.001414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.135371Z","title":"F., Leike, J., and Lowe, R","venue":null,"work_id":"b5070efb-c96f-4739-a4d2-23eac20e0db2","year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.056217Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:8f5845658206f9403f94726dc490f4e5d5639afc9e9b7da360f4f816d4e04ed8","observation_id":"6baabdaf-39d8-49c0-9a0a-198d02f2d057","resolution":{"observed_at":"2026-08-06T23:55:21.197182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.943616Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"b6e57cf4-c571-4144-a867-dda8633586a5","year":2023},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.139566Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:22690131620444d1f9bff497485f69f5f24780ff1dd91951e2a46aef29adf26f","observation_id":"f4682ebe-c9bd-4415-aa2b-018b7cde02f4","resolution":{"observed_at":"2026-08-06T23:55:21.034443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.720598Z","title":"Warm: on the benefits of weight averaged reward models","venue":null,"work_id":"079d17e3-f7e0-4bb4-bef2-38ea1a418921","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.263261Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:18d22636b8df93e899cc2cd05e1fa77d5f6c678923d3295d50fc75df544e6634","observation_id":"aef2970b-9987-4889-a699-3eeb389b82eb","resolution":{"observed_at":"2026-08-06T23:55:20.818159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:55:18.379988Z","title":"Proximal policy optimiza- tion algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.379988Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:6f6829533910ef1edfb1afc39ff5cd7dfdccbf405404a7f03eaf17a37f4cf76f","observation_id":"91244e0a-5e96-480d-92cc-fd7a69542366","resolution":{"observed_at":"2026-08-06T23:55:18.379988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:55:18.568219Z","title":"K., Wu, Y ., and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.568219Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:c6b196f941ac8a1e25fc5cb1cc0952315edfe425ad5fe54259fb78a431109088","observation_id":"1a06f961-8d08-4459-8a29-ff3f0708672a","resolution":{"observed_at":"2026-08-06T23:55:18.568219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.560185Z","title":"A long way to go: Investigating length correlations in RLHF, 2024","venue":null,"work_id":"09faeb52-78a2-430e-aed0-39495736d6cd","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.684210Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:07e8dce0c5cada69966f4eb9ce1e5d36c14800e8928af767ded8a763dd72d8ad","observation_id":"38a3a96d-3812-48de-9d11-7143f4d24650","resolution":{"observed_at":"2026-08-06T23:55:20.621509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-21T14:30:27.126880Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-06T23:55:18.885733Z","title":"M., Lowe, R., V oss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.885733Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:1930b119e9ed6c21ab2db9f134f32742d5eec6a54033f63f974dc549acd59df9","observation_id":"f1bce08e-2765-4650-ad99-e26236de101d","resolution":{"observed_at":"2026-08-06T23:55:18.885733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:18.993349Z","title":"Interpretable preferences via multi- objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.993349Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:db6a93605be4b69d1ccfa1c8dffbc68e03c41c4b84b6886c2a681242701e6879","observation_id":"fe93116b-d111-474a-a295-271f3d6f21d5","resolution":{"observed_at":"2026-08-06T23:55:18.993349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.412911Z","title":"Transforming and combining rewards for aligning large language models","venue":null,"work_id":"90b3a182-666d-4452-bef0-8d9328e17f25","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:19.143851Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:b40b90b92108a1301381a00b4e7dd2b34ddae017ad157317e3b9182976972e39","observation_id":"5f3038dd-c30c-4500-b988-cc7392c35913","resolution":{"observed_at":"2026-08-06T23:55:20.466949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.167211Z","title":"E., and Stoica, I","venue":null,"work_id":"f4adf9e9-cb24-44bf-b2f8-bea00c34eca9","year":null},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:19.259824Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:5d27e363a3b104067925535995fb9bdae51b595e7161895df3ff4689cb4e6131","observation_id":"2bfa2f02-2fad-454c-b3c1-0db4f0351f45","resolution":{"observed_at":"2026-08-06T23:55:20.274208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T23:55:16.329410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.329410Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:1dba7c9c43f88cb228f855edc77a5f1cbb160efb177c65716c29e1cac64a1c24","observation_id":"3e40a4df-025b-4e51-bfef-1be957b8cf7f","resolution":{"observed_at":"2026-08-06T23:55:16.329410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:19.860287Z","title":"confidence","venue":null,"work_id":"3285a89e-47af-4e02-8826-f848fb08f153","year":2023},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:19.365804Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:0626a6be6c612d4d63cc89f15901839425c80ab40546f32c4f048808e114ea67","observation_id":"29deb25a-cbbc-4ee4-ba28-98eb74ad27e1","resolution":{"observed_at":"2026-08-06T23:55:19.995163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T09:52:21.675888Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 9 inbound Pith citation observations for arXiv:2506.15651."}