{"as_of":"2026-08-10T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8378b5b454674ef3bd34288f6ad18343f8cec3783a0edecc72129d7aab73eb8","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:49.368412Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:24:20.906356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13702","snapshot_observed_at":"2026-08-03T14:24:20.906356Z","title":"Value-free policy optimization via reward partitioning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-06T07:38:24.259000Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:20.906356Z"},"links":{"cited_paper":"/paper/2506.13702","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:93f0ab3e778fcfc511848386c5a3b488f6cf177ab73f6d67ac1cf8cb28c46377","observation_id":"58037a65-8d50-481a-8f54-57238aecf6dd","resolution":{"observed_at":"2026-08-03T14:24:20.906356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13702/citation-record","integrity":"/paper/2506.13702/integrity","json":"/paper/2506.13702/citation-record.json","paper":"/paper/2506.13702"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.817651Z","title":"Rrhf: Rank responses to align language models with human feedback,","venue":null,"work_id":"689d45a3-3e19-4df1-9400-01176e558b34","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.229111Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:6d9b0eabc1fb0901aeb290b2830264d666729c537fcbc92115829914f8aa7eb1","observation_id":"7d1e438d-cf68-4314-9294-e3aba8e89a37","resolution":{"observed_at":"2026-08-07T00:31:49.821253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T00:31:49.233090Z","title":"Rlhf workflow: From reward modeling to online rlhf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.233090Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:488bd473ea0198f49f42440ddc664d5daca04ef146f2870b939003b4eaed3bce","observation_id":"2be3843c-13a7-4a96-be30-6551e33c15e0","resolution":{"observed_at":"2026-08-07T00:31:49.233090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.807541Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms,","venue":null,"work_id":"c4a797a5-fc61-4a58-89fb-7e0804b1777a","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.236673Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:ed78f3845fcfae7f0508d815792f221154ee4d3aaf1cc3371f48f1e9aaa567fe","observation_id":"c6740c56-52c9-4774-bd8a-e41a14d51045","resolution":{"observed_at":"2026-08-07T00:31:49.811145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.241247Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.241247Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:df46c1da9e4a5ca2204159c6769da0eaf327266571633b1a7951f08157cd2caa","observation_id":"0364f190-1d28-4505-b39d-323425002d42","resolution":{"observed_at":"2026-08-07T00:31:49.241247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.791719Z","title":"Generalized preference optimization: A unified approach to offline alignment,","venue":null,"work_id":"204007d9-d2ae-4c1d-81a3-8208c7bf8a1e","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.244822Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:39a625ccdb39714fc444290885066cfbc448b8d686ea23957faad319954ae607","observation_id":"170bbaa3-093d-4e6d-a9ea-1ab59660b784","resolution":{"observed_at":"2026-08-07T00:31:49.795028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19107","last_updated":"2024-05-29T14:11:29Z","snapshot_observed_at":"2026-08-09T08:35:59.600823Z","submitted_at":"2024-05-29T14:11:29Z","title":"Offline Regularised Reinforcement Learning for Large Language Models Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19107","snapshot_observed_at":"2026-08-07T00:31:49.248057Z","title":"Offline regularised reinforcement learning for large language models alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.248057Z"},"links":{"cited_paper":"/paper/2405.19107","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:6aba8508bb4657ea25c580f627d5a8de62a2d99a9d67878f348aca167daa1ab4","observation_id":"848849fa-a948-449d-976a-015b8f7fb801","resolution":{"observed_at":"2026-08-07T00:31:49.248057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.782171Z","title":"Model alignment as prospect theoretic optimization,","venue":null,"work_id":"26aafd6a-a12f-4cf5-917a-cac2461113f7","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.251658Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:6dd3b70ca14235fceb718639a58f812b377100f6a459a7323bcf2127722bd146","observation_id":"ffe4e4d3-d6bc-4aa1-8966-aed06214946b","resolution":{"observed_at":"2026-08-07T00:31:49.785448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.254776Z","title":"Instruction tuning for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.254776Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:eeace2a6d1fcb6f746fab55ee9b9a4bcc1bd53e52198ac09c6b1fec5e49484c0","observation_id":"6699bbdc-bc91-4330-9be9-e3013b84bd57","resolution":{"observed_at":"2026-08-07T00:31:49.254776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:31:49.259019Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.259019Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:692f38e82c6d1720a0d0c1d0c60ede66190714b9d5a9ab3002208c8651211075","observation_id":"fb0b05c5-085b-4d2c-b061-a4849a9ca341","resolution":{"observed_at":"2026-08-07T00:31:49.259019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.772001Z","title":"Trust region policy optimization,","venue":null,"work_id":"e37ac855-c9a1-48ff-8996-635a12857ddd","year":2015},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.263025Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:16966ada1a460c7286df5d288be498892496f940068a4cc6f85cea627155cb01","observation_id":"ff63cb40-f6da-4a37-bc7b-9a7815d04dff","resolution":{"observed_at":"2026-08-07T00:31:49.775562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.266419Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.266419Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:314984259ec93aa5069c8ec221cfea266e879af7e48f56b0978b1b9373a9e42c","observation_id":"3b6d7598-5178-4239-ba4a-ae55ba16e2ab","resolution":{"observed_at":"2026-08-07T00:31:49.266419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:31:49.269741Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.269741Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:2b31e92d45a82e6feb6ca23c599d8bea7b5dcaa11cc4dbddd5ebf3fe3e012036","observation_id":"bc503428-b3a4-4786-8dab-a4ce942ed59c","resolution":{"observed_at":"2026-08-07T00:31:49.269741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.755349Z","title":"The claude 3 model family: Opus, sonnet, haiku,","venue":null,"work_id":"9250ce1d-d789-4ca5-8936-91dabe4e19f3","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.272989Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:c95987a189fafce6314c9f9c77a7fee0f01c54ac3d2e8823a12c797d8c4f1239","observation_id":"41a6f198-8d6c-4b8d-bc1c-481155b2fd4c","resolution":{"observed_at":"2026-08-07T00:31:49.759152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.745103Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,","venue":null,"work_id":"b0397a8c-066a-4921-8e72-5646dc4037e8","year":2025},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.277532Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:fc28667a37eaa51cd1980063dec52c5b5dd79d0663a7a4903ab09b66bbb18bf7","observation_id":"3056ed27-b9f2-4632-b3e7-ae35c551fc55","resolution":{"observed_at":"2026-08-07T00:31:49.748634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.734518Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"bdaa25b6-19ea-4023-9fe4-1473d15f1bc5","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.280587Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:2baccf466f629de5c9322575f102cc3a98413660083ead034bcd5dd5b7d97225","observation_id":"cff56b3c-ca0c-458e-92b1-3cd249e28eca","resolution":{"observed_at":"2026-08-07T00:31:49.738544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-09T04:25:12.977504Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T00:31:49.283692Z","title":"Rrhf: Rank responses to align language models with human feedback without tears,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.283692Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:97c25b35ef0d4113c8093c73f116e6f0ac872bd98288859f93abb3ff0b8bddb6","observation_id":"0d3ab8c7-82c6-472a-85b1-493e848b096b","resolution":{"observed_at":"2026-08-07T00:31:49.283692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.723892Z","title":"CREAM: consistency regularized self-rewarding language models,","venue":null,"work_id":"bac41e95-6def-48c3-be03-a686f90983b3","year":2025},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.287664Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:0e1614d1cca3079581816c17f6db60b994c88b49e0fcdda717b1683a29aeee5e","observation_id":"8e48b80a-f4a5-4b8c-a791-f04e80f8181f","resolution":{"observed_at":"2026-08-07T00:31:49.727405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.714517Z","title":"Self-rewarding language models,","venue":null,"work_id":"e16c2725-8535-46cd-b49e-45d2c8ba68f3","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.290911Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:6ec00be6e49c1604709d546661a9f906b6c84c7fcbe356384186c00e6ca20c8b","observation_id":"0267a425-915e-45a6-a8be-60f29fa65428","resolution":{"observed_at":"2026-08-07T00:31:49.717989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T00:31:49.293738Z","title":"Slic-hf: Sequence likelihood calibration with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.293738Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:97cc7d7103ccb052b10bad5fb5415b25f52d1d25b2069dd3b4e5b866fa186c41","observation_id":"586052fa-c7b1-42f5-b7d7-8e467d6e9ebc","resolution":{"observed_at":"2026-08-07T00:31:49.293738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:31:49.297393Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.297393Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:80bee7253431f07832079e4574f8acd8048522a9ddc7fdfa1b71295ed681c1ee","observation_id":"15bae0be-35c2-44a2-bd98-8b0a8a551dbd","resolution":{"observed_at":"2026-08-07T00:31:49.297393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:31:49.300277Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.300277Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:1f1e60b9215d635f876104baa7fc77e735017d33cfbe1b2e2645f88a2899bad3","observation_id":"163ec618-6992-4fcf-ae7d-625c5dd4cf0a","resolution":{"observed_at":"2026-08-07T00:31:49.300277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-07T00:31:49.303322Z","title":"Nemotron-4 340b technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.303322Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:2f635bb59296630a4926c7b71be20e5c2c48a9ddf1bcd8e588c00d4e184f4f96","observation_id":"2acf63e6-e1f2-4458-9c6f-427069ec6d62","resolution":{"observed_at":"2026-08-07T00:31:49.303322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.306523Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.306523Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:e76fc67baffbac3cb51b006628a09e9703dd6ddf501afec9dad7c01198681f02","observation_id":"4d4fdb80-5a78-4520-b10c-85b41aeb9bdf","resolution":{"observed_at":"2026-08-07T00:31:49.306523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.698349Z","title":"A general theoretical paradigm to understand learning from human preferences,","venue":null,"work_id":"3c2f277e-70db-486e-944b-5b7e674a81c1","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.309895Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:3acdacbb2550ed6aca50cb8a7cd3497a6eebc672c49929b515b83da70e6b5602","observation_id":"b0633016-44d7-4956-a4d3-a56c310edf3e","resolution":{"observed_at":"2026-08-07T00:31:49.702083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.689341Z","title":"Advances in prospect theory: Cumulative representation of uncertainty,","venue":null,"work_id":"f4f386d6-feb8-4073-97a9-aad165b88457","year":1992},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.312840Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:86ccbd392fea0935cf3fb23bb9ed52734354fb35e4c4ce69a8ac81d36326db6d","observation_id":"f496c456-0247-4c12-b42d-338ec07bae57","resolution":{"observed_at":"2026-08-07T00:31:49.692625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T00:31:49.315854Z","title":"Ultrafeedback: Boosting language models with high-quality feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.315854Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:f94e0dc37588bd6d5273b07fb6a467968f2891725565a4e240ed0c73dcd90deb","observation_id":"efb414d2-4669-4b7d-a5eb-e8b65446ba0b","resolution":{"observed_at":"2026-08-07T00:31:49.315854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.679085Z","title":"Alpacaeval: An automatic evaluator of instruction-following models,","venue":null,"work_id":"ce99277b-b7a9-4b0b-9dd2-9e7d0bcfce1c","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.319398Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:68bc9c785305bf0eaed08e468234f1737b3d928eac83163dba1ae0ba46e59913","observation_id":"7262b461-5e87-474b-85dd-4960bc1d8d80","resolution":{"observed_at":"2026-08-07T00:31:49.683149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.322892Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.322892Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:f8751a41afc093a567e334a35548fae72ee834bf62f9dbda80b54fbbb04177cc","observation_id":"29968375-32d7-49df-bf73-acb155c2e158","resolution":{"observed_at":"2026-08-07T00:31:49.322892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T00:31:49.326677Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.326677Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:7c35718e539df3afd48995ac1386d774643bb1f0e8756a0639bb927003a1b976","observation_id":"3b78be03-5ee5-44bc-9e33-ffbaca2aee97","resolution":{"observed_at":"2026-08-07T00:31:49.326677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:31:49.330155Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.330155Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:85fe9c7765f65fe1d518073e67843dff1c4b276673db9ad82a73467a413a1600","observation_id":"2b07c684-5b46-4e78-b412-79e35815b2c1","resolution":{"observed_at":"2026-08-07T00:31:49.330155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.662954Z","title":"Scaling up models and data with t5x and seqio,","venue":null,"work_id":"d471bc27-8cc3-4e85-9da8-b6b9d33d2480","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.333178Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:d3dfb47e7d88a6109c8f80f21c347929cdcbcfc8120ba1f9b1c9987b09ce67f9","observation_id":"17fce266-5c00-4cb7-852f-8059491a6f1c","resolution":{"observed_at":"2026-08-07T00:31:49.667368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.336652Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.336652Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:69fa66dad80e26432fd7c55a9a0a6dbb56e8239c70ef0f75d23a91dba35f8194","observation_id":"7fb1bfa7-74ea-4b4e-93ff-1c7f6ca8f999","resolution":{"observed_at":"2026-08-07T00:31:49.336652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.646187Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":"34653c7c-ec7b-4973-8f49-2c147f15fb0b","year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.340728Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:7a4f639b83c82cd9b686f2f0bcaf135d9b5d6ee6abaa4f6a84ac763ee3c0e278","observation_id":"ab1ceb4b-8ef4-47cf-9ba4-9e85d1442e9d","resolution":{"observed_at":"2026-08-07T00:31:49.650316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T00:31:49.344252Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.344252Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:0cf22136dc69ebe66ba9e0ec5f1cd37360388af40d0539b82b221c69754d4efa","observation_id":"edba6570-de0e-4a9b-9180-4ac294105a90","resolution":{"observed_at":"2026-08-07T00:31:49.344252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T00:31:49.347457Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.347457Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:71faa6e78307ebaaae68be30e7a5437ba27efa5ac90eece8383d209bdd98399f","observation_id":"526d418b-dd00-4c0e-8f9d-32f81c3ca79a","resolution":{"observed_at":"2026-08-07T00:31:49.347457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.350864Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.350864Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:200b38e0cc2c8184498913b341673f38dea0f19c8009a99bf16a7d1a1e90ec02","observation_id":"762e49c1-11ac-4aac-bf6e-ea267e0d46be","resolution":{"observed_at":"2026-08-07T00:31:49.350864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.629818Z","title":"A diversity-promoting objective function for neural conversation models,","venue":null,"work_id":"5947ea9f-03d8-400a-a8aa-8c47c528642c","year":2016},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.354796Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:d948697f1f2bf7f2873e11828c70555ef54eefb1b3246f1ebf53694a56c033f4","observation_id":"1c2fe268-4e4a-4beb-85cc-8fae2cd7f522","resolution":{"observed_at":"2026-08-07T00:31:49.634832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T00:31:49.358212Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.358212Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:1e8d3aaa25004eec2b1bd73ce268df89eab673a63c46bcd20c1ff08eff7a14ef","observation_id":"c84dfb56-bb9d-4b13-8610-5d333745a163","resolution":{"observed_at":"2026-08-07T00:31:49.358212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T00:31:49.361713Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.361713Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:521c2dd7212406fcbc2a103874b13e27703ebe11b554fddd4a361228398d007a","observation_id":"0c8e74f6-81cf-4fd3-9c7a-df18274cf243","resolution":{"observed_at":"2026-08-07T00:31:49.361713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.619771Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"b60d6fdb-4252-4841-93f4-74e1519ec1a6","year":2024},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.365419Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:79b61b09f6175d5514f95b061bd323231af0d554584535d45380aa34f6eee9cf","observation_id":"d8c59ea9-5c99-45a5-bbd7-2c6f3921eecc","resolution":{"observed_at":"2026-08-07T00:31:49.623894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:49.368412Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.368412Z"},"links":{"citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:19f7f4cbf225eb95be1674f26231fbc9d636786b7c428483c4e7b1e41ff24709","observation_id":"9a806028-570f-490e-bdc4-e44b439ba7ac","resolution":{"observed_at":"2026-08-07T00:31:49.368412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.13702."}