{"as_of":"2026-08-10T19:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e8549ae2ad8ff861077aa7001022a319651580355fea6e3f36712a994125ce8","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:32:47.980568Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04357/citation-record","integrity":"/paper/2502.04357/integrity","json":"/paper/2502.04357/citation-record.json","paper":"/paper/2502.04357"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.01013","last_updated":"2024-06-18T20:53:08Z","snapshot_observed_at":"2026-07-06T18:24:13.721696Z","submitted_at":"2024-06-03T05:46:53Z","title":"Scalable Ensembling For Mitigating Reward Overoptimisation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01013","snapshot_observed_at":"2026-08-09T11:32:47.815161Z","title":"M., Rafailov, R., Sharkov, S., Li, X., and Koyejo, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.815161Z"},"links":{"cited_paper":"/paper/2406.01013","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:ab7a6dd329c38f76836a6fda5a43b75e4fe74beec8c7cb8efb8294ddff51ffeb","observation_id":"4ec1d8ef-30e2-4d74-a1e8-a9787bb5b65f","resolution":{"observed_at":"2026-08-09T11:32:47.815161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-09T11:32:47.848862Z","title":"Raft: Reward ranked fine- tuning for generative foundation model alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.848862Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:1606116659695c81befbebd445a4ea140ca9362b093623816992907797880602","observation_id":"a45fd102-318c-4a34-ac81-ab1bff7d3bb1","resolution":{"observed_at":"2026-08-09T11:32:47.848862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-09T11:32:47.854763Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.854763Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:df524013597e2d4eb1fee3deaf323f30464ea04bd2d09ab524d6dfadbd25c9df","observation_id":"740ba855-2b7f-4785-8f0a-a938e5a28e0b","resolution":{"observed_at":"2026-08-09T11:32:47.854763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-06T18:01:48.915710Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-08-09T11:32:47.870940Z","title":"and Ruder, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.870940Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:78d3b137020744ba86101fe2333d325b88d138f81a37ccc01927888496440e0e","observation_id":"63b25d2b-3b20-4b58-be64-a4dc1fdbd324","resolution":{"observed_at":"2026-08-09T11:32:47.870940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13711","last_updated":"2023-05-23T05:57:09Z","snapshot_observed_at":"2026-08-08T00:56:28.434895Z","submitted_at":"2023-05-23T05:57:09Z","title":"LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13711","snapshot_observed_at":"2026-08-09T11:32:47.892435Z","title":"and Chen, Y .-N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.892435Z"},"links":{"cited_paper":"/paper/2305.13711","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:126d24ca88508d9027dca327b1035082bd36939d4c11ee2ae4510534ae1066e4","observation_id":"8dc45675-9d25-4c49-be35-f7f3e5710963","resolution":{"observed_at":"2026-08-09T11:32:47.892435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-09T11:32:47.897367Z","title":"Y ., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y ., and Zhou, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.897367Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:f8370909f18c09f464f5a2aefe7b7d884e4f8e11a7fbd034d114b4964e1c838e","observation_id":"d8610c8a-67c7-4f11-894a-7304a70c704c","resolution":{"observed_at":"2026-08-09T11:32:47.897367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-07-06T19:25:23.988463Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-09T11:32:47.903311Z","title":"Uncertainty-aware reward model: Teaching reward models to know what is unknown","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.903311Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:3b174694a824eff28d9c0cc9615d29889461b44a4998c26bc04bfadd79c413f0","observation_id":"93c01cb5-4458-43ae-9a23-55364f6abbff","resolution":{"observed_at":"2026-08-09T11:32:47.903311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-09T11:32:47.909420Z","title":"Generative reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.909420Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:334119dbcb6e5b7739f55bbb063a1b857158e308b04b30db7f6a4b82974dbeb2","observation_id":"5469c96b-8161-467c-ab2f-18e5acfa753a","resolution":{"observed_at":"2026-08-09T11:32:47.909420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-09T11:32:47.914729Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.914729Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:c80888495bf47319be4202828d07030999d3197cbd66563400075ecac5bda506","observation_id":"5d6b8332-5e9b-4309-bc3c-b8e45aa4390d","resolution":{"observed_at":"2026-08-09T11:32:47.914729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08114","last_updated":"2024-06-28T08:22:01Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T23:09:00Z","title":"Active Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08114","snapshot_observed_at":"2026-08-09T11:32:47.920478Z","title":"Active preference learning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.920478Z"},"links":{"cited_paper":"/paper/2402.08114","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:508518c1d71af84c5e1c0a24f7e6ddfdbaf6dc1b01be4187307fc06dc968a09d","observation_id":"535875a3-e053-4e8f-8882-9686a245d96a","resolution":{"observed_at":"2026-08-09T11:32:47.920478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:32:48.515293Z","title":null,"venue":null,"work_id":"bf3714ae-0aa1-4803-97db-b6b0ec749907","year":2014},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.932569Z"},"links":{"citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:21c9436e27b973a381de30e2b9eda2da7568f7d5ea11c8fe7b247f0b5667f7ff","observation_id":"eb2610df-38d2-44ef-95a4-26cf73d61a6f","resolution":{"observed_at":"2026-08-09T11:32:48.521803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-09T11:32:47.943542Z","title":"J., Seedat, N., H ¨uy¨uk, A., and van der Schaar, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.943542Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:c9c43c439faf6d6a9f9becb53569971bfacd592383d538855dbc9c225d2dcb38","observation_id":"0376cf34-9ce7-4b62-a313-8f94310bd832","resolution":{"observed_at":"2026-08-09T11:32:47.943542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T11:32:47.948743Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.948743Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:6d7c88d0e24b07442e79e43316f863bd5143d0821f3d17c829eb27191d1d529f","observation_id":"d499de53-74e5-4414-9332-c343e3d29346","resolution":{"observed_at":"2026-08-09T11:32:47.948743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-09T11:32:47.954111Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.954111Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:51bc7754511b541ee3cd82eb554f717116b2b9119c73c68d4c32039289ab4bf1","observation_id":"ff9dfb75-04a8-4166-a8ae-d6d1ef3c2093","resolution":{"observed_at":"2026-08-09T11:32:47.954111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-09T19:07:54.536460Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-09T11:32:47.959132Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.959132Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:32d2a54e7577c7f53226178728228b1e5bc214ef9d871584e017923a018e2be8","observation_id":"e5842996-e851-443c-bc8d-630bf3aa9e5c","resolution":{"observed_at":"2026-08-09T11:32:47.959132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-09T11:32:47.964012Z","title":"Gibbs sampling from human feedback: A prov- able kl-constrained framework for rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.964012Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:667f6726ee8547553611aadcc3e466438908ce827a8b2771ce1e90674795967a","observation_id":"5d3c12fb-96dc-4564-94f4-9bdabdee110e","resolution":{"observed_at":"2026-08-09T11:32:47.964012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-10T08:43:37.608281Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-09T11:32:47.969450Z","title":"Reg- ularizing hidden states enables learning generalizable reward model for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.969450Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:3e2e284d5342baf8b95c72ae088608d175bc9b9a6f0fc6aad95b2b62457e7310","observation_id":"092df6bd-e88b-4aae-885b-4a2b3ff2ef0a","resolution":{"observed_at":"2026-08-09T11:32:47.969450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-10T18:32:18.501904Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-09T11:32:47.975340Z","title":"Generative verifiers: Re- ward modeling as next-token prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.975340Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:5c72d7a4c974cf54faebb10d700345393094c0eba5080b564d5397e402db7cd0","observation_id":"e0de104c-e2b0-423f-8b48-3982a8e8f688","resolution":{"observed_at":"2026-08-09T11:32:47.975340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03708","last_updated":"2024-08-17T13:39:13Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:35:26Z","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03708","snapshot_observed_at":"2026-08-09T11:32:47.980568Z","title":"Beyond one-preference-for- all: Multi-objective direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.980568Z"},"links":{"cited_paper":"/paper/2310.03708","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:55a2fc2612acc458f9b1f38803668807fb3b7a055a98760d21df4960fa899d55","observation_id":"45a48ba9-d9d9-43f3-b378-08ce8b1b1ee4","resolution":{"observed_at":"2026-08-09T11:32:47.980568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:32:47.826867Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.826867Z"},"links":{"citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:f40bccf216afd32316273d5e5db65c98808a7faa1d592df75d4ac7dd47711027","observation_id":"e238bb2b-38b7-4b13-ba6f-0de4e32cb726","resolution":{"observed_at":"2026-08-09T11:32:47.826867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-09T11:32:47.937569Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.937569Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:1646adc0c771c21a91ec200ec4feaa8d594c4672c2ef57d8a4421a44f3864f0d","observation_id":"da49c087-30ab-44db-a2ae-fcca4e1ecc80","resolution":{"observed_at":"2026-08-09T11:32:47.937569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:32:48.534719Z","title":"Mitigating the alignment tax of rlhf","venue":null,"work_id":"023e208e-111d-4bd1-9834-b6432b90a167","year":2024},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.887158Z"},"links":{"citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:2d0c7d01caf8dc079748da2b21f2561600550ba22b0586262d81de97d8c78cfe","observation_id":"d98f3d92-adc3-4ff9-ade5-ae8b43c7dd97","resolution":{"observed_at":"2026-08-09T11:32:48.540662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T11:32:47.865198Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.865198Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:c34151892db150312767ea2d581ca8680eef7c0505cfcbab2688217ad492b50d","observation_id":"93890cd6-f7ca-4de8-91e6-db57fbf7eceb","resolution":{"observed_at":"2026-08-09T11:32:47.865198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-09T11:32:47.837706Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.837706Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:944803e30aafb76c9355081d5e19a40297d9c1fb97deb5a483696c41dcd4cf14","observation_id":"5258d64d-76db-48d4-accb-5a59a590a8eb","resolution":{"observed_at":"2026-08-09T11:32:47.837706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T11:32:47.876159Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.876159Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:f25099255898206ca0f896e5b1eec1b52179dbb386346c30a63f6d961a3bb86e","observation_id":"84a95113-7295-4417-9801-6b5db597809e","resolution":{"observed_at":"2026-08-09T11:32:47.876159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-09T11:32:47.881802Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.881802Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:6574e46f41dd73791d730190dbc6bb327258387b4309811336fa2b8d12dc2513","observation_id":"8910208e-b3f3-44f8-a999-9658650905ba","resolution":{"observed_at":"2026-08-09T11:32:47.881802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-07-06T06:30:55.970076Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-09T11:32:47.832124Z","title":"Universal sentence encoder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.832124Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:518e7bfb525d4f81216012f20f750014c6d805b6924d39a68fcbdae75bee61cf","observation_id":"e7daa53e-fbc0-42f7-9b19-acbe282a8b69","resolution":{"observed_at":"2026-08-09T11:32:47.832124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T11:32:47.821353Z","title":"Training a helpful and harmless assistant with rein- forcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.821353Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:d09a4c8a4985615cf6ba0b98541f353659449521a7eb102e93c4c7c47a219bfc","observation_id":"5702f126-caa3-4064-9d95-00667a1ce62f","resolution":{"observed_at":"2026-08-09T11:32:47.821353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-06T11:46:01.178597Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-09T11:32:47.926599Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.926599Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:4279124d17aadf9d3544bc0e0591c14a751c511a34038a7b6272f02863db4db5","observation_id":"54600f9e-9665-49c2-8dac-a1a8bb733340","resolution":{"observed_at":"2026-08-09T11:32:47.926599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T11:32:47.843461Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.843461Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:adf325cc9e10af9072cd6fcd3074c4cd030ac02bb9f99e256d667f92decfcd22","observation_id":"911ebb87-91d6-44e2-b8eb-35204a5ed526","resolution":{"observed_at":"2026-08-09T11:32:47.843461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:32:47.859773Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.859773Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:06a0079eff7189b169a93c3c2af30c6c4382449d3d8f5c4b7ac4057cbe4c08bb","observation_id":"9e101d40-dd11-4c11-b33c-761b28fc3665","resolution":{"observed_at":"2026-08-09T11:32:47.859773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2502.04357."}