{"as_of":"2026-08-22T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b4c60c046f866093a656999ebbb1d3646429a9b278480eed838ad933cec9168","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:34:08.140575Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14180/citation-record","integrity":"/paper/2607.14180/integrity","json":"/paper/2607.14180/citation-record.json","paper":"/paper/2607.14180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:08.069750Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:08.069750Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:261258777abb363b18b9144f4db7d1dd653c58799d0a0c6339c5883d5ace85e4","observation_id":"81902e09-5352-4574-85ba-cd3d46dc33d1","resolution":{"observed_at":"2026-08-02T03:34:08.069750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13885","last_updated":"2020-11-27T18:20:04Z","snapshot_observed_at":"2026-08-16T19:02:46.417901Z","submitted_at":"2020-11-27T18:20:04Z","title":"Offline Learning from Demonstrations and Unlabeled Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13885","snapshot_observed_at":"2026-08-02T03:34:07.409979Z","title":"Offline learning from demonstrations and unlabeled experience.arXiv preprint arXiv:2011.13885,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.409979Z"},"links":{"cited_paper":"/paper/2011.13885","citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:e101a85a2b408a29aae38737b47a75e3e790e58fa6b2e550a3c6c3b664e8c302","observation_id":"c23ed939-7c91-4a28-bad8-be69926009aa","resolution":{"observed_at":"2026-08-02T03:34:07.409979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.564105Z","title":"B Related Work Learning dynamics from preferences.Several recent papers have detailed methods for improv- ing world model realism with human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.564105Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:ec288108774082769a982523a87df37e27826d9e94f8b24d544aa21a6ea4cdf2","observation_id":"c7a23a83-34a6-433a-8cc7-5c5bd8df2a24","resolution":{"observed_at":"2026-08-02T03:34:07.564105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.621247Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.621247Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:d949c1b4cabb15c40bcdefda5957a1ec825663abefc943fb94227a7b8becece6","observation_id":"13d2aa79-ed5d-4d6d-9e15-7819d2346b4d","resolution":{"observed_at":"2026-08-02T03:34:07.621247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.691390Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.691390Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:dc18d9b353a674ab57472b3be05bfdf6ee86549c6215eeecb1360ef7bc50d98e","observation_id":"1d43dec6-693c-489f-ac45-2fa0bf2a0691","resolution":{"observed_at":"2026-08-02T03:34:07.691390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.760846Z","title":null,"venue":null,"work_id":null,"year":2080},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.760846Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:e50d13242567d4871d0afd90932ccf999cdb9839c71be421b20722efe3d1990f","observation_id":"3bbd50fe-6b46-47e1-b7b5-740e21459c6f","resolution":{"observed_at":"2026-08-02T03:34:07.760846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.830742Z","title":"Each block applies a depthwise3×3convolution, LayerNorm, a two-layer MLP with4×channel expansion and GELU activation, and a residual connection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.830742Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:50ea59b0282340ab8fb88e5964d89b8e27fcf1fe496e53c810bcc7a5ea19117c","observation_id":"033f6775-e28b-462c-b54a-301043b8db97","resolution":{"observed_at":"2026-08-02T03:34:07.830742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.906979Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.906979Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:2b6a252c46936f5cd581263aa0e446f85f5d7d241294b406971454f36c6c8c88","observation_id":"a7372a0a-d3d4-4db0-bd9b-d7b2e658303f","resolution":{"observed_at":"2026-08-02T03:34:07.906979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:08.140575Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:08.140575Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:2a60fe8d67070974581eaca6f1305e7496f8737534e0456f7be7bbfbe175fd01","observation_id":"a5f4839e-bdbf-4cad-b1b3-0f301a7f1d3e","resolution":{"observed_at":"2026-08-02T03:34:08.140575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15960","last_updated":"2026-05-18T10:20:13Z","snapshot_observed_at":"2026-07-31T17:35:31.437364Z","submitted_at":"2026-05-15T13:54:08Z","title":"Imperfect World Models are Exploitable","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15960","snapshot_observed_at":"2026-08-02T03:34:07.153034Z","title":"Whitammer, David Abel, Mykel J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.153034Z"},"links":{"cited_paper":"/paper/2605.15960","citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:a97cb7a274b3c729623f5d956e9aa18a4400d6a0d8812d228154333b598c276d","observation_id":"11ded2c5-6edd-4bb3-bca8-1fe989368908","resolution":{"observed_at":"2026-08-02T03:34:07.153034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.225485Z","title":"Anatomy of a robotaxi crash: Lessons from the Cruise pedestrian dragging mishap","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.225485Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:da95ce73dd00ae25d9d8a20ab369c11b915238ba38c865a02704ddb0d52a1108","observation_id":"be5ffce1-f1c9-4881-a715-217acad4f859","resolution":{"observed_at":"2026-08-02T03:34:07.225485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.047631Z","title":"UCB/EECS-2019-98","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.047631Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:0181276aa445704dea0153bc62b8f377e9fc8d635aaa440a60d19ccdb3ce8dd9","observation_id":"eed79e46-0b8f-46a1-b0b9-c0c0f5239bae","resolution":{"observed_at":"2026-08-02T03:34:07.047631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.497880Z","title":"A Preliminaries We briefly review the necessary background to understand DLHF and RENEW","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.497880Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:925dd27459c58729a4e7c3f797d206cb6ea95f004eda6ed81a02fe3b680fcd11","observation_id":"e890f298-edd6-4fe6-b626-b361672a8d97","resolution":{"observed_at":"2026-08-02T03:34:07.497880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-08-21T15:57:22.153221Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T03:34:07.294572Z","title":"Sergey Levine, Aviral Kumar, George Tucker, and Justin Fu","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.294572Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:d14ec031b87ced483b62bbc447d7546957c5c6463b0d47cf0e6ffa039f60d853","observation_id":"b48c5f8a-842e-4a3e-baa4-33838d3e9472","resolution":{"observed_at":"2026-08-02T03:34:07.294572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.979332Z","title":"•Maze10×10.A grid world where an agent navigates corridors to reach a goal position","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.979332Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:140bfc418a223995a1f6c2d1905a1c854f26972179eb62d42caac297b9c65a6e","observation_id":"0b9a4e69-7a96-433e-b3be-b680ac711614","resolution":{"observed_at":"2026-08-02T03:34:07.979332Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.342134Z","title":"IntPhys 2019: A benchmark for visual intuitive physics under- standing.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(9):5016–5025,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.342134Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:d7a09e8406c2fa7ba7737938679ad334d7540cc1ed4b310ee34aa8c651af9109","observation_id":"128e33b3-63fa-4113-8434-8cfe7ac66e63","resolution":{"observed_at":"2026-08-02T03:34:07.342134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T11:53:56.691524Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2607.14180."}