{"as_of":"2026-08-15T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a80cc25c3c45071048bfbb6c2fa42bfac0d8370829ac502644d5e0302f909a6d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:48:07.210826Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09973/citation-record","integrity":"/paper/2507.09973/integrity","json":"/paper/2507.09973/citation-record.json","paper":"/paper/2507.09973"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.089065Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.089065Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:71c57c526a89726f51a58bce6176bf59b4b42bd4f4aea048e77396f2b7842294","observation_id":"bb79d5da-4c7a-40e6-b4d7-0ed61c769ad0","resolution":{"observed_at":"2026-08-06T17:48:07.089065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T17:48:07.092692Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.092692Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7ec6514d9cc52a6af7bbbd3c8128779258d0fdd1277aed0847430b5c85ea4d22","observation_id":"5a83696c-c906-427c-90cf-c33df3bad179","resolution":{"observed_at":"2026-08-06T17:48:07.092692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13582","last_updated":"2022-05-04T08:55:21Z","snapshot_observed_at":"2026-08-14T08:24:15.287834Z","submitted_at":"2021-09-28T09:29:15Z","title":"PPL-MCTS: Constrained Textual Generation Through Discriminator-Guided MCTS Decoding","version":2},"cited_work":{"arxiv_id":"2109.13582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13582","snapshot_observed_at":"2026-08-06T17:48:07.692079Z","title":"PPL-MCTS: Constrained Textual Generation Through Discriminator-Guided MCTS Decoding","venue":"cs.CL","work_id":"b7280d65-6962-4ff0-ac57-5e8e3166dc97","year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.095711Z"},"links":{"cited_paper":"/paper/2109.13582","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:5fb844352fc3980c0c4df2d00b83584b932aadc3e6dc5e959cea52854b4a7789","observation_id":"9fc9e5de-1c04-4e9a-8616-6d0672d9b7d1","resolution":{"observed_at":"2026-08-06T17:48:07.695107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.098573Z","title":"Rm-r1: Reward modeling as reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.098573Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:27a99b03599b27fa458160a9ca58a0660372078a192d5c3ff966bf770ff9f298","observation_id":"86b77f26-9ca0-4d57-8d65-8bcf86e0ee1e","resolution":{"observed_at":"2026-08-06T17:48:07.098573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.716040Z","title":"B., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":"b323c98d-6c37-4d5d-a1e3-758a6d8ccf00","year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.101195Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:5155aa8c60d5e94d5e01d8c9e13fb763411118a841981e023c9bafbe631323e7","observation_id":"8b4b6dfb-eff9-41c9-a1a2-99a9b1cd50b8","resolution":{"observed_at":"2026-08-06T17:48:07.718376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-06T17:48:07.103616Z","title":"W., Hou, L., Longpre, S., Zoph, B., Tay, Y., Fedus, W., Li, Y., Wang, X., Dehghani, M., Brahma, S., Webson, A., Gu, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.103616Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f998cd26caf14c7cbb8d66213471541b01de29518989e4318e1ecc53a7141a86","observation_id":"5027851b-45cc-41f4-9282-970a71d218c4","resolution":{"observed_at":"2026-08-06T17:48:07.103616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03793","last_updated":"2025-02-10T14:08:19Z","snapshot_observed_at":"2026-08-14T20:03:22.255390Z","submitted_at":"2025-02-06T05:47:37Z","title":"It's All in The [MASK]: Simple Instruction-Tuning Enables BERT-like Masked Language Models As Generative Classifiers","version":2},"cited_work":{"arxiv_id":"2502.03793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03793","snapshot_observed_at":"2026-08-06T17:48:07.604735Z","title":"It's All in The [MASK]: Simple Instruction-Tuning Enables BERT-like Masked Language Models As Generative Classifiers","venue":"cs.CL","work_id":"5090f212-7232-44a1-a561-154aabfaf56b","year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.106359Z"},"links":{"cited_paper":"/paper/2502.03793","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:e9a5bc330c8455c1066a7a9d58a0b4051f8e234387824116bea67848ae2a8548","observation_id":"f86633c8-6b4d-4265-b4bc-f7dbf11bcbe6","resolution":{"observed_at":"2026-08-06T17:48:07.607922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:48:07.109354Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.109354Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3979d2c9babe786827fac15cbf9c40cc826f9824029b0ebd298e7f2556f70d64","observation_id":"c0138e18-c753-41df-a667-1b813b9a507e","resolution":{"observed_at":"2026-08-06T17:48:07.109354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-12T14:49:28.599595Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-06T17:48:07.111658Z","title":"and Li, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.111658Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:a3ea1b1add850dc531e5806878f174bf43791df79096a83f9ffd5a82799a88fa","observation_id":"7ffd1b75-1817-4897-87f9-9b0a4fe3efaa","resolution":{"observed_at":"2026-08-06T17:48:07.111658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.707989Z","title":"L., and Vigliocco, G","venue":null,"work_id":"c910854f-916b-44ae-aa7c-63a8ee96da1a","year":2012},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.114627Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:72547dc12a85988a18d5ca0ee47dd71a114631e4fd2cf35e30bc7e5b2980725c","observation_id":"f98dd840-a992-4e95-b9f3-932fd9983cac","resolution":{"observed_at":"2026-08-06T17:48:07.710863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-06T17:48:07.117097Z","title":"Scaling laws for reward model overoptimization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.117097Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:a5b93e6d387b7aca55b961bbd440345a8d091b76929116a49c7c3effb2cdbf50","observation_id":"17de84cb-7b24-49a6-ae43-762183081e98","resolution":{"observed_at":"2026-08-06T17:48:07.117097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.119680Z","title":"Making pre-trained language models better few-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.119680Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:8ed48b5beece2721d404b1665320fc223f41740888c2d155f8478461efbd580c","observation_id":"07f91a81-d6f9-4dca-9acd-b5e61a593cd5","resolution":{"observed_at":"2026-08-06T17:48:07.119680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04611","last_updated":"2025-03-06T16:57:26Z","snapshot_observed_at":"2026-08-07T17:24:09.707716Z","submitted_at":"2025-03-06T16:57:26Z","title":"Towards Data-Efficient Language Models: A Child-Inspired Approach to Language Learning","version":1},"cited_work":{"arxiv_id":"2503.04611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.04611","snapshot_observed_at":"2026-08-06T17:48:07.572329Z","title":"Towards Data-Efficient Language Models: A Child-Inspired Approach to Language Learning","venue":"cs.CL","work_id":"8dcd22fa-e01c-45dd-87f9-32d16a733652","year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.122038Z"},"links":{"cited_paper":"/paper/2503.04611","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:18521fe7f9197f3b5cb5498e67ee78fee7390116fa405b1221c9fb162efb807d","observation_id":"02458464-c5a9-4475-8514-9a64609c1b63","resolution":{"observed_at":"2026-08-06T17:48:07.575213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:48:07.124633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.124633Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:d8f56bcace21450e432772bde737e242619774bef10e7a01618535ebb922d1c7","observation_id":"80c8c4af-44f5-4f4f-8a0c-f6eb2c026317","resolution":{"observed_at":"2026-08-06T17:48:07.124633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T17:48:07.127115Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.127115Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:dbe43da8af644430cbc16363d08675e70af706fea5cf469913ea53e8a34b6e78","observation_id":"c11d3822-6db0-494b-a4f7-02e261dfed68","resolution":{"observed_at":"2026-08-06T17:48:07.127115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06000","last_updated":"2024-12-08T17:19:48Z","snapshot_observed_at":"2026-08-14T12:26:41.406022Z","submitted_at":"2024-12-08T17:19:48Z","title":"Does RLHF Scale? Exploring the Impacts From Data, Model, and Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06000","snapshot_observed_at":"2026-08-06T17:48:07.129543Z","title":"Does rlhf scale? exploring the impacts from data, model, and method, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.129543Z"},"links":{"cited_paper":"/paper/2412.06000","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:c0cb1153b621b73df370c37dc2171539dbd7e0431aa2b473f37a6de92af31654","observation_id":"a15d9dde-7f19-4637-a4f5-ecb0c0c58b8e","resolution":{"observed_at":"2026-08-06T17:48:07.129543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-14T19:54:00.470999Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-08-06T17:48:07.131920Z","title":"and Ruder, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.131920Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:d0e77c9d2ff3edd2fd2237b879970d27117f9d6fe111b06b5f92827ae356926e","observation_id":"841364ec-0573-4c03-a26a-f6ec90b140b8","resolution":{"observed_at":"2026-08-06T17:48:07.131920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T17:48:07.134619Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.134619Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:a1b9a12e64b5572367061a9876e45fd2d00395303483cb37dd1076ab2a80a2b3","observation_id":"db601eee-593a-4c61-a1d8-3d38dfbc423c","resolution":{"observed_at":"2026-08-06T17:48:07.134619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-12T23:38:02.782103Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-06T17:48:07.137146Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.137146Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7498512505f40d0bde44e54e947aa33f7b394547a8627e3b41dabe9aa6bb4e86","observation_id":"42fe3188-5383-423d-b63f-299496c0b3a7","resolution":{"observed_at":"2026-08-06T17:48:07.137146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-13T12:02:41.563345Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-06T17:48:07.139475Z","title":"M., Stanley, O., Nagyfi, R., ES, S., Suri, S., Glushkov, D., Dantuluri, A., Maguire, A., Schuhmann, C., Nguyen, H., and Mattick, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.139475Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:180df834e803023b40160d4228e2ddf8f1e0097f6125fabd91f42cbc5825b0c4","observation_id":"53dde41c-fc6c-4f35-97a7-5e515f38a3fa","resolution":{"observed_at":"2026-08-06T17:48:07.139475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-15T03:01:41.971978Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T17:48:07.141889Z","title":"Y., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y., Smith, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.141889Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3459e439bfaddd3afddc51ec4195440f30c85e86172ce4965aec70b45c739497","observation_id":"459455e7-a116-4b41-a7fc-2cb1cfac5cc5","resolution":{"observed_at":"2026-08-06T17:48:07.141889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03090","last_updated":"2019-11-08T07:05:20Z","snapshot_observed_at":"2026-08-11T00:43:30.125982Z","submitted_at":"2019-11-08T07:05:20Z","title":"What Would Elsa Do? Freezing Layers During Transformer Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03090","snapshot_observed_at":"2026-08-06T17:48:07.144511Z","title":"What would elsa do? freezing layers during transformer fine-tuning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.144511Z"},"links":{"cited_paper":"/paper/1911.03090","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:faa8b54c9f3d440c4577d2f2c3ba9252ab281ec249ab77ccf140c0435dd3379c","observation_id":"8156c2eb-62bd-4796-9ebe-ca1460e7ab41","resolution":{"observed_at":"2026-08-06T17:48:07.144511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-06T17:48:07.146902Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.146902Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:ea09eeee654fd91a54baa0f557da395de39cf420d6ced6a5c003c8688e4b8174","observation_id":"8e9201f9-ecad-4092-8e74-1c7c14d616c4","resolution":{"observed_at":"2026-08-06T17:48:07.146902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-06T17:48:07.149469Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.149469Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7c9dc20e832862cc5910d063a0a57fb64e5411f3fb48a39b5573de7d927236c3","observation_id":"5a54112a-3525-44c0-9a96-08ef27a9f9dc","resolution":{"observed_at":"2026-08-06T17:48:07.149469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T17:48:07.152003Z","title":"Let's verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.152003Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3a1c006bdbc431a70b33c831bccb0353b9005037a741f321837366157211fa19","observation_id":"34cc45f9-ca75-409f-9df3-578986314c80","resolution":{"observed_at":"2026-08-06T17:48:07.152003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-06T17:48:07.154579Z","title":"Y., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y., and Zhou, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.154579Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:4bb7d0b35aca2f3b6f633a6b69af2e89f928808892bbefc1e8742a1e5e422d7e","observation_id":"e99e856f-6e33-4b1c-817e-67625d4bcaca","resolution":{"observed_at":"2026-08-06T17:48:07.154579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-06T17:48:07.157051Z","title":"F., Cheng, K.-T., and Chen, M.-H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.157051Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3b849f0fda033c5a5eb5c06306e1413d7a3959119077a232034b77cf1cd65150","observation_id":"8c8ae2a7-6cf2-4a81-9f5d-2416827e6c61","resolution":{"observed_at":"2026-08-06T17:48:07.157051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-08-14T13:26:32.548079Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-06T17:48:07.159727Z","title":"Routing to the expert: Efficient reward-guided ensemble of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.159727Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:ffeaa6f357b2523f3582e3b40cb7fe7450be7df8a1e974321db540fc2237a330","observation_id":"e8578aff-60bd-4b87-a2f6-fbdf9c4f6b1c","resolution":{"observed_at":"2026-08-06T17:48:07.159727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T17:48:07.162023Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.162023Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:de2f079e4cdca57b81e1cdae0ab683d0750522b12c7d1a8a9c99ad4ccacf69ad","observation_id":"7cb9e172-efc3-4fa9-932a-ea5822a66474","resolution":{"observed_at":"2026-08-06T17:48:07.162023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T17:48:07.164185Z","title":"Webgpt: Browser-assisted question-answering with human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.164185Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:a1e11f8dd6368c9b87803384a9a43daa1c5be16748695e845fb7cad86e73cde3","observation_id":"f02cbb16-bc9d-4043-8623-29554abc7501","resolution":{"observed_at":"2026-08-06T17:48:07.164185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04085","last_updated":"2020-04-14T14:57:40Z","snapshot_observed_at":"2026-08-12T23:25:05.204139Z","submitted_at":"2019-01-13T23:27:58Z","title":"Passage Re-ranking with BERT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.04085","snapshot_observed_at":"2026-08-06T17:48:07.166590Z","title":"and Cho, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.166590Z"},"links":{"cited_paper":"/paper/1901.04085","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:115a1187e3e511adc038e6f5211d3a3be6c6bbdd1029770074343bc7df8a547a","observation_id":"3279575f-3339-45b6-9782-4f22b9fa39ce","resolution":{"observed_at":"2026-08-06T17:48:07.166590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-12T23:40:54.718397Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T17:48:07.168990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.168990Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:709c5a01d052ee63991720fbbeaa1f7717d215db4d6b04fd66e47cdd60711af5","observation_id":"57c0428d-05be-40a2-bc31-aae00aa506bc","resolution":{"observed_at":"2026-08-06T17:48:07.168990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T17:48:07.171387Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.171387Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:95b9864937ff43ddd22f67c3d2ce78a5741e12e8db5cac21410e8cbe81ab6ce7","observation_id":"6a490881-e7e0-4992-9191-c5b2b4fd2089","resolution":{"observed_at":"2026-08-06T17:48:07.171387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05821","last_updated":"2023-11-10T01:35:51Z","snapshot_observed_at":"2026-08-13T05:28:43.603491Z","submitted_at":"2023-11-10T01:35:51Z","title":"Let's Reinforce Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05821","snapshot_observed_at":"2026-08-06T17:48:07.173925Z","title":"Let's reinforce step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.173925Z"},"links":{"cited_paper":"/paper/2311.05821","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3d9fbdffee11b55c6d3d6da5495ea000bd9227bab5a6bdc05a681b7164680d38","observation_id":"7a8c7288-d584-4bb4-95e9-f3b0ba4fb327","resolution":{"observed_at":"2026-08-06T17:48:07.173925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-08-14T16:16:21.567225Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-06T17:48:07.176314Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.176314Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:32d415e86d0534120badd17872499f388eed418f705ca00e5b21c8d7cc915897","observation_id":"af90b18e-5bee-4183-85a5-62a94e9b2624","resolution":{"observed_at":"2026-08-06T17:48:07.176314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T17:48:07.178654Z","title":"Warm: On the benefits of weight averaged reward models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.178654Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f3f102a7289d969081dafe440376c1a80fa58c4bb7261384310fc9f2fe755f2f","observation_id":"c96758dd-57fc-40a8-9c3f-1eaab651fd41","resolution":{"observed_at":"2026-08-06T17:48:07.178654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04823","last_updated":"2024-10-31T16:48:51Z","snapshot_observed_at":"2026-08-12T23:47:59.146161Z","submitted_at":"2024-06-07T10:48:45Z","title":"BERTs are Generative In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04823","snapshot_observed_at":"2026-08-06T17:48:07.181168Z","title":"Berts are generative in-context learners, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.181168Z"},"links":{"cited_paper":"/paper/2406.04823","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:2f164bc76d6d4cd5a3082d5f084ef9bde21bcab16200945429b91c20baae9b28","observation_id":"e265842c-7e61-40cc-afc5-6409dd85f99f","resolution":{"observed_at":"2026-08-06T17:48:07.181168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07676","last_updated":"2021-01-25T10:56:45Z","snapshot_observed_at":"2026-08-07T14:12:26.620672Z","submitted_at":"2020-01-21T17:57:33Z","title":"Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07676","snapshot_observed_at":"2026-08-06T17:48:07.183516Z","title":"and Schütze, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.183516Z"},"links":{"cited_paper":"/paper/2001.07676","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:c57277604d3986a493086a68a6becec6ea6d079e72b8fce17a119d680967fc45","observation_id":"55c7ffa2-a916-4d5a-9f42-37c62c029a48","resolution":{"observed_at":"2026-08-06T17:48:07.183516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07118","last_updated":"2021-04-12T08:16:59Z","snapshot_observed_at":"2026-08-14T09:17:46.140640Z","submitted_at":"2020-09-15T14:18:53Z","title":"It's Not Just Size That Matters: Small Language Models Are Also Few-Shot Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07118","snapshot_observed_at":"2026-08-06T17:48:07.185809Z","title":"and Schütze, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.185809Z"},"links":{"cited_paper":"/paper/2009.07118","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:8ce9d87aa7504af67feb2b95e1e7efc87146d3b9d28ca7dc871730a1dd3927ac","observation_id":"abb3c454-889b-487e-9e31-95e36072bc82","resolution":{"observed_at":"2026-08-06T17:48:07.185809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16155","last_updated":"2023-09-28T04:05:13Z","snapshot_observed_at":"2026-08-13T10:03:27.535022Z","submitted_at":"2023-09-28T04:05:13Z","title":"The Trickle-down Impact of Reward (In-)consistency on RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16155","snapshot_observed_at":"2026-08-06T17:48:07.188338Z","title":"The trickle-down impact of reward (in-)consistency on rlhf, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.188338Z"},"links":{"cited_paper":"/paper/2309.16155","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:ec0d6faf9cb8ccf1db2ace7b4bb755ca0389fdc615a757811b286025e3ee5a3c","observation_id":"2237a1c5-ba21-4367-b8f6-dc294cd7fbbc","resolution":{"observed_at":"2026-08-06T17:48:07.188338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-14T18:24:15.384302Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-06T17:48:07.190751Z","title":"R., Zhao, D., Patel, N., Naghiyev, J., LeCun, Y., and Shwartz-Ziv, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.190751Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:0d3e92562095a8136559bdab84d4f459fdd428c397ba9cc5b39602e1ea0af66d","observation_id":"986bf3e7-c475-4689-8ffb-a0a7508a53d1","resolution":{"observed_at":"2026-08-06T17:48:07.190751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.193757Z","title":"D., and Su, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.193757Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:277d96b5f98aedeb79dafe2f1a1fb9688a2bb49f976bf172d58ee933ef5a4a7a","observation_id":"60319909-5b82-4069-bfa0-023280b205c8","resolution":{"observed_at":"2026-08-06T17:48:07.193757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04547","last_updated":"2023-11-08T09:26:27Z","snapshot_observed_at":"2026-08-13T05:30:02.292295Z","submitted_at":"2023-11-08T09:26:27Z","title":"Large GPT-like Models are Bad Babies: A Closer Look at the Relationship between Linguistic Competence and Psycholinguistic Measures","version":1},"cited_work":{"arxiv_id":"2311.04547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04547","snapshot_observed_at":"2026-08-06T17:48:07.280836Z","title":"Large GPT-like Models are Bad Babies: A Closer Look at the Relationship between Linguistic Competence and Psycholinguistic Measures","venue":"cs.CL","work_id":"89eb2071-1a8f-4384-b884-7b929b87f340","year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.196004Z"},"links":{"cited_paper":"/paper/2311.04547","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:c2cb182caf4969e8af3665a768ef0f8d69a9dca8ab1ab5226fa42c10162f4354","observation_id":"faba13a6-cc57-4e9c-9c9b-8f8b81993a6d","resolution":{"observed_at":"2026-08-06T17:48:07.285710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05583","last_updated":"2020-02-05T12:00:32Z","snapshot_observed_at":"2026-08-14T16:32:33.364760Z","submitted_at":"2019-05-14T13:17:26Z","title":"How to Fine-Tune BERT for Text Classification?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05583","snapshot_observed_at":"2026-08-06T17:48:07.198467Z","title":"How to fine-tune bert for text classification?, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.198467Z"},"links":{"cited_paper":"/paper/1905.05583","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:840774dc3d43402f1dacd3b6a0ea1502778ae5706b5c38e1bd5fd82d70f85cce","observation_id":"d63fe4c4-efae-4003-a284-2e58a6e4d6a0","resolution":{"observed_at":"2026-08-06T17:48:07.198467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-12T23:44:06.669155Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T17:48:07.201291Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.201291Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:d4b688f154a8708cac0fd86bf7a18b5dbf1c0ab32f798f2ed2825bb5c2052300","observation_id":"5be4873b-40e3-45a8-896b-91a648f1633d","resolution":{"observed_at":"2026-08-06T17:48:07.201291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-08-14T20:02:35.071920Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-06T17:48:07.203840Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.203840Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:b438c979f455d1182237959e819ef7806a5051e69195d720915e6ac121e5c612","observation_id":"79311ea0-1930-4be7-87c8-9a9fc00b6d25","resolution":{"observed_at":"2026-08-06T17:48:07.203840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T17:48:07.206091Z","title":"Y., Guu, K., Yu, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.206091Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:06bfa169513ea7c800d741f9482de8521dacfb6ad57549a7d5ca6f4372816895","observation_id":"de32fa4b-0030-450f-a9c6-4897c78b760c","resolution":{"observed_at":"2026-08-06T17:48:07.206091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02381","last_updated":"2025-02-28T23:33:22Z","snapshot_observed_at":"2026-08-15T00:41:12.060792Z","submitted_at":"2024-10-03T11:01:25Z","title":"MetaMetrics: Calibrating Metrics For Generation Tasks Using Human Preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02381","snapshot_observed_at":"2026-08-06T17:48:07.208459Z","title":"I., Anugraha, D., Susanto, L., Kuwanto, G., and Wijaya, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.208459Z"},"links":{"cited_paper":"/paper/2410.02381","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:14bc8f2b555afbc2e0df635bd5353b233b5f9165be878a3c12013c7897062f1c","observation_id":"a71856fb-f940-4e8f-8098-d0b4794b6b94","resolution":{"observed_at":"2026-08-06T17:48:07.208459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1792","last_updated":"2014-11-06T23:09:37Z","snapshot_observed_at":"2026-08-14T23:12:35.177313Z","submitted_at":"2014-11-06T23:09:37Z","title":"How transferable are features in deep neural networks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1792","snapshot_observed_at":"2026-08-06T17:48:07.210826Z","title":"How transferable are features in deep neural networks?, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.210826Z"},"links":{"cited_paper":"/paper/1411.1792","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:aef6dc34204849309316a170724e1daa1f5b202a83bb1a5f605f33a7f6737f8d","observation_id":"b5ece352-57bb-4918-bb9e-91cd6961c748","resolution":{"observed_at":"2026-08-06T17:48:07.210826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2507.09973."}