{"as_of":"2026-08-04T22:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a67da357b629b2b56790f2044007c1eafc27ba607015df72a180640b6d918613","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:50:47.902911Z","state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.13833/citation-record","integrity":"/paper/2604.13833/integrity","json":"/paper/2604.13833/citation-record.json","paper":"/paper/2604.13833"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-07-06T18:36:07.983955Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:3147d718a647512e14237b332b5250a4e7bd09bda761d7aa1aedcf33baf177c2","observation_id":"93163713-4833-40c2-ad31-24fd5d384d74","resolution":{"observed_at":"2026-05-10T14:00:29.610326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":"2310.03716","doi":"10.48550/arxiv.2310.03716","metadata_source":"pith","pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A long way to go: Investigating length correlations in rlhf","venue":"cs.CL","work_id":"23d0dfe6-c919-4498-8696-1e298c7834e9","year":2023},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:4321af07f7e64a6c82538ac1c1d3fe2a4a88e892a7a0a447af18325381e7a975","observation_id":"f5703def-dd90-49d8-8885-be064697dd6a","resolution":{"observed_at":"2026-05-10T14:00:29.614432Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-04T12:42:12.769532Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2501.09620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-07-03T01:37:30.312996Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023.https://huggingface","venue":null,"work_id":"f6a453de-be92-4f70-8dc2-f355469d9bd7","year":2025},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:ce096099e36949591e6f0b122ef19ad88f86a5141b3e8b5034754122920cfa88","observation_id":"cfc6e527-9550-452b-97d5-ed00910a49c1","resolution":{"observed_at":"2026-05-10T14:00:29.618255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"919f11a1-66e3-478a-a64d-ffce6550994f","year":null},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:56442e38f9a8a02a69b2be4e8f0f829160b456adc824c674dd42a4b817d3ff89","observation_id":"f45a0ccb-bc98-4615-be12-c9d49c4529aa","resolution":{"observed_at":"2026-05-18T21:11:52.027838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8283.2466","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assumption 3(Top-K Margin Condition).For si =P f(w i) and ideal Top-K indices Jwi, there existsδ >0such that: min j∈Jwi min t /∈Jwi (|si,j| − |si,t|)≥δ","venue":null,"work_id":"43f12cf8-6522-48ab-9bb8-6f14ffbb9194","year":2011},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:90f37adb64bdcca28b5a3e1f65f6599aa269830017a4a7315db27da51e3a9c28","observation_id":"e9e7b4a4-8b3d-4c0a-b2c0-a5d4468ba555","resolution":{"observed_at":"2026-05-10T14:00:29.622746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 5 of 5 outbound references and 0 inbound Pith citation observations for arXiv:2604.13833."}