{"as_of":"2026-08-14T08:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f689cc165ad7ee83be43d42d218d2e4e8ad0e0c724e867a9dc0c11c53d73b146","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:18:40.394477Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:09:46.031769Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T17:08:01.250732Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":"2502.08922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08922","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-consistency of the internal reward models improves self-rewarding language models","venue":null,"work_id":"8a8cfa53-ca3f-4829-a1e8-673c93decd35","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.08922","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:ae943a79d24d5e67aecdbac55daf941d81dfcc044f6fc0b572e2eebef4464d4c","observation_id":"7a523748-4ad1-4f59-b1a4-e6c6a8b30bc4","resolution":{"observed_at":"2026-05-13T01:36:24.205165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08922","snapshot_observed_at":"2026-08-07T05:09:46.031769Z","title":"Self-consistency of the internal reward models improves self-rewarding language models.arXiv preprint arXiv:2502.08922, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.031769Z"},"links":{"cited_paper":"/paper/2502.08922","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:0d11964cd51d03ae9fd622bd226e02af168292a0d0c493b2f65d8d4f79243ead","observation_id":"97b1f075-2d3f-4a02-bc76-f2266f53f3a7","resolution":{"observed_at":"2026-08-07T05:09:46.031769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08922","snapshot_observed_at":"2026-08-05T23:06:49.746071Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-13T04:45:14.014270Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.746071Z"},"links":{"cited_paper":"/paper/2502.08922","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:a5251daa1379c1f8d92900ecc5e8b92f9934bce231865faed433327e153f9cc3","observation_id":"18db4afd-80b6-4da9-b0f4-c8e5b09750d9","resolution":{"observed_at":"2026-08-05T23:06:49.746071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":"2502.08922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08922","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-consistency of the internal reward models improves self-rewarding language models","venue":null,"work_id":"8a8cfa53-ca3f-4829-a1e8-673c93decd35","year":2025},"citing_paper":{"arxiv_id":"2604.03993","last_updated":"2026-04-05T06:30:50Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:30:50Z","title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T16:58:42.129870Z"},"links":{"cited_paper":"/paper/2502.08922","citing_paper":"/paper/2604.03993"},"observation_digest":"sha256:3e03d19307b7ed2ef294bd487b1f653fda61d69559c8bf116ed1d5d5850d1e18","observation_id":"9b43603d-a844-4c6f-9943-96b546c31597","resolution":{"observed_at":"2026-05-13T17:08:01.253192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08922/citation-record","integrity":"/paper/2502.08922/integrity","json":"/paper/2502.08922/citation-record.json","paper":"/paper/2502.08922"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.596597Z","title":"Meta-rewarding language models: Self-improving alignment with LLM -as-a-meta-judge","venue":null,"work_id":"ef051487-8872-4584-b98d-209d80c5151b","year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.508691Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:ec751636d102dd9745c6804416319d72011f0710bfb318751181cfa1e4df64cf","observation_id":"eb139baf-7580-4c82-8155-cc86f5db0d28","resolution":{"observed_at":"2026-08-07T23:18:41.599511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:39.557512Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.557512Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:509116ad6756bec5e6a57f65c67afdc1e61857e7a7d0398be0b551e3e0f644ca","observation_id":"e724814b-ff4b-49ce-bd8d-18587919ea51","resolution":{"observed_at":"2026-08-07T23:18:39.557512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T23:18:39.615070Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.615070Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:7d47b3be55c6c1c056cc0b077f1430a4bb6f4bcb200666c2fd55cd4b711689d4","observation_id":"9e892fca-77c4-4940-9743-4061a4d54fa9","resolution":{"observed_at":"2026-08-07T23:18:39.615070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.581123Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":"d74c630c-4872-4687-a31d-f31a2fa48a20","year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.664489Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:7e672938f1a966c56f1a3bb5f7838ea81137fe0c3e6d76f43ea93916695fa8fc","observation_id":"88a07b6c-c796-4124-84bb-16bfdcd50f94","resolution":{"observed_at":"2026-08-07T23:18:41.585312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T23:18:39.720611Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.720611Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:cf378875198c1e3d1092c94602222f38dd54b2ae96da1ef8b03e6980c6b71046","observation_id":"7b5a1aec-238c-4517-8551-cdacf8658b67","resolution":{"observed_at":"2026-08-07T23:18:39.720611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:39.782053Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.782053Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:bd04a276403d7d3ccfd076b7833b6d7cafe14a2e7d89e956718e8baeddeac31c","observation_id":"8421daa7-8b6a-424e-8e6b-1658d8da8220","resolution":{"observed_at":"2026-08-07T23:18:39.782053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:39.785911Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.785911Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:4808daf1617b2b3fd4dd88d664bb5ac399efe328c8c00f869a7958c8cc03c6fc","observation_id":"f0305702-5474-4972-9d5e-3d4203c67e02","resolution":{"observed_at":"2026-08-07T23:18:39.785911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.560661Z","title":"H., Baker, B., Gao, L., Aschenbrenner, L., Chen, Y., Ecoffet, A., Joglekar, M., Leike, J., et al","venue":null,"work_id":"586fa28d-ee80-4dd8-9c49-1a584768a2b5","year":null},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.789152Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:774db9be3c12e08f5a78112fabf45c24f4269c03461548a31694ed964e11e3c4","observation_id":"6e509c3c-332b-4979-9a0d-763c8681ae98","resolution":{"observed_at":"2026-08-07T23:18:41.564457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.549496Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":"d9e17f97-4ea7-4bd5-a44e-15c6ff6e5453","year":null},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.792319Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:f555737e3c63e2f0aaef0f26e271006472b1ff345c14ae18939d0d70561207d3","observation_id":"2c615e10-6313-4219-b04a-95e09e6e31af","resolution":{"observed_at":"2026-08-07T23:18:41.554612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-13T05:02:02.370925Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-07T23:18:39.795597Z","title":"H., Baker, B., Gao, L., Aschenbrenner, L., Chen, Y., Ecoffet, A., Joglekar, M., Leike, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.795597Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:12913d30cf16873f8c6ff9103394bd96b48edac82c4ba01a707cecbfd9c548b6","observation_id":"d46c78dd-3243-433c-9bfb-621697db17cf","resolution":{"observed_at":"2026-08-07T23:18:39.795597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-07T23:18:39.803268Z","title":"K., Scheurer, J., Rando, J., Freedman, R., Korbak, T., Lindner, D., Freire, P., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.803268Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:a202ab65f75f6bdc7f9c30fe4f2ff91fcba41dc33b808cbe11a70ffb6a0f812f","observation_id":"1163456b-9200-41ef-9695-08a2fd6e6d56","resolution":{"observed_at":"2026-08-07T23:18:39.803268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.362761Z","title":null,"venue":null,"work_id":"16a2a45d-ad79-403a-aa73-ee5b5ed84973","year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.806277Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:8a8d77cbdada84653c454f36230265fca22123aab3d6e16de80aaa975167a9ca","observation_id":"c1249323-4353-49ba-bdd0-b7cbd6e58b82","resolution":{"observed_at":"2026-08-07T23:18:41.432377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:39.809418Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.809418Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:af01246fc840b91441c4e3fb44e10b8e01548a9e7426858fcf12c5eadc77bf4a","observation_id":"c7fafe0c-56c6-451f-b9cd-cf2034c80ae6","resolution":{"observed_at":"2026-08-07T23:18:39.809418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00438","last_updated":"2024-05-01T10:43:55Z","snapshot_observed_at":"2026-08-13T00:17:44.407842Z","submitted_at":"2024-05-01T10:43:55Z","title":"MetaRM: Shifted Distributions Alignment via Meta-Learning","version":1},"cited_work":{"arxiv_id":"2405.00438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.00438","snapshot_observed_at":"2026-08-07T23:18:40.882702Z","title":"MetaRM: Shifted Distributions Alignment via Meta-Learning","venue":"cs.LG","work_id":"c2896288-1e3a-4193-888b-3b232ae20cff","year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.812498Z"},"links":{"cited_paper":"/paper/2405.00438","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:6049afb15a69ca8fca7ed032cf00cfe4e6bda68acf9534ba05097ea16228273b","observation_id":"b6f2cf57-9420-4492-867a-7d51ea2b01a1","resolution":{"observed_at":"2026-08-07T23:18:40.888353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T23:18:39.815907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.815907Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:f56dc534177e4b752fcddc5b9ee0f341c4a34bdc741866099a8a6ea27ddd4b82","observation_id":"a435c9e9-de7c-40ac-ac1c-dbf3d4c2c9f1","resolution":{"observed_at":"2026-08-07T23:18:39.815907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.347604Z","title":"and Bengio, Y","venue":null,"work_id":"ee49c59f-2cf8-4bb7-b3c5-7c631e8aee93","year":2004},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.819576Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:13f35649504a1e331a5341d6212248436d6feb854f125a8edac711002c7a89ae","observation_id":"0faf2016-1197-42bf-9496-d41fc3b97446","resolution":{"observed_at":"2026-08-07T23:18:41.350955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:18:39.822951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.822951Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:d031e102ea55b89fbf04d71b67063bcc2295a98bf2a96cdac5098a81cb8c0adc","observation_id":"81736b11-9a44-490a-b19a-5d4fe0d9ae56","resolution":{"observed_at":"2026-08-07T23:18:39.822951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T23:18:39.831125Z","title":"A survey on llm-as-a-judge, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.831125Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:6bfccb535ea1ccecf3945ec9548bab4026740f48a725225213150a1285a75596","observation_id":"d4e7d5dd-168e-4055-9f3a-aca257409d27","resolution":{"observed_at":"2026-08-07T23:18:39.831125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.336453Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"c6fc23fe-634a-4df2-a063-6967195d2fcc","year":null},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.833827Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:d590da698ac237ee84a2a3b1e8bc639c8690a8992a3c146cfcb2c6c66a179ebd","observation_id":"a82e82e3-79b1-4e5c-8908-5d982ded6360","resolution":{"observed_at":"2026-08-07T23:18:41.340024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-07T23:18:39.836718Z","title":"S., Hou, L., Wu, Y., Wang, X., Yu, H., and Han, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.836718Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:8e6edf0f5e868d9aec31c7d36a84a8114cf733c715fe2264fbc1da1c55846c58","observation_id":"c61ef4f5-603d-4696-bfcf-d7a32ee4e1da","resolution":{"observed_at":"2026-08-07T23:18:39.836718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11176","last_updated":"2023-05-24T04:17:34Z","snapshot_observed_at":"2026-08-13T11:39:15.813076Z","submitted_at":"2023-05-18T17:59:49Z","title":"Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11176","snapshot_observed_at":"2026-08-07T23:18:39.880512Z","title":"Instruct2act: Mapping multi-modality instructions to robotic actions with large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.880512Z"},"links":{"cited_paper":"/paper/2305.11176","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:9c7e40db2c24e8466ccc09253af39271929c7a1b61f9117c0424b5c8fa2e91cd","observation_id":"89abcfe5-4980-4830-a70f-a54d6375978a","resolution":{"observed_at":"2026-08-07T23:18:39.880512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T23:18:39.944964Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:39.944964Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:4c1488ea83e02ec949d2f502d2882aacb7ab4d37162a81bfe0b90e567611ab5e","observation_id":"fa350cd6-20a9-4804-aa81-23c4452eae54","resolution":{"observed_at":"2026-08-07T23:18:39.944964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.001004Z","title":"A survey of reinforcement learning from human feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.001004Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:2717999682058ef0ce70e74356ddf45da3486966a53013d63686e44d86475a46","observation_id":"4af70f34-2ea6-4aab-8e0f-5eda5533175c","resolution":{"observed_at":"2026-08-07T23:18:40.001004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.324059Z","title":"o pf, A., Kilcher, Y., von R \\","venue":null,"work_id":"db75182d-a3eb-4b1d-8bad-5d7e9799140d","year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.054020Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:34106ee67f09cae63ae8b02cfc5b7689dbc48e39ddd717ac76e5509e528d732b","observation_id":"967174d5-25f9-43bf-b316-f897652d2b9c","resolution":{"observed_at":"2026-08-07T23:18:41.328414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T23:18:40.095737Z","title":"Y., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y., Smith, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.095737Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:6d0cc29ccda7708db6ce1cedb76c4a8b384d8e56a45992cb773a23a96cf5ba4a","observation_id":"c9581455-2476-41a8-b899-d9ccae36168b","resolution":{"observed_at":"2026-08-07T23:18:40.095737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T23:18:40.157736Z","title":"Y., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y., and Zhou, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.157736Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:1a79f741f7d262df04bf05e28313f2e0e25bc69b3e0a40213193d1d6acb632b0","observation_id":"0cfd3253-0bdc-4c0a-accf-e50797e06f7a","resolution":{"observed_at":"2026-08-07T23:18:40.157736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.177163Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.177163Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:00a6a9592c23f1691d221e5ff1226951539a108cb0860bec7b745a57eb6f1ae3","observation_id":"295294a0-e936-4b54-972d-5442e5f58595","resolution":{"observed_at":"2026-08-07T23:18:40.177163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09442","last_updated":"2023-08-21T07:49:37Z","snapshot_observed_at":"2026-08-13T22:21:16.803858Z","submitted_at":"2023-08-18T10:14:35Z","title":"BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09442","snapshot_observed_at":"2026-08-07T23:18:40.180688Z","title":"Biomedgpt: Open multimodal generative pre-trained transformer for biomedicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.180688Z"},"links":{"cited_paper":"/paper/2308.09442","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:6d936597e1502f51bc8981f77b430f9086105fd5710ff9815de4794968e60a4e","observation_id":"e09f68dd-25f7-442b-9268-0b9981e5ea09","resolution":{"observed_at":"2026-08-07T23:18:40.180688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.308861Z","title":"Introducing ChatGPT","venue":null,"work_id":"99d11958-4d4a-4e77-ac3b-cfebfce3bc71","year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.184253Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:3aa3119c6805101be43beeac05cd2936a4120ae301acd6b5e82f2b8a278ae24a","observation_id":"c5a02edd-f8ea-4c74-9aca-1e8d39ffe7e1","resolution":{"observed_at":"2026-08-07T23:18:41.312585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.187371Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.187371Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:dd7c35bf1fdf0a18917f5e1881b3400f6d38099a537d14b4235b92f061277f50","observation_id":"20395fd6-42f6-4f65-821c-fdbb441104fd","resolution":{"observed_at":"2026-08-07T23:18:40.187371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-13T03:45:12.203086Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-07T23:18:40.193451Z","title":"Y., Yuan, W., Cho, K., He, H., Sukhbaatar, S., and Weston, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.193451Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:f0c4ec6939417ffdf4a58c6e4fe3edaddc869ecaa985fad713b7b35fa5ebe965","observation_id":"7de1d6b8-31cd-43dd-8c9e-2f83d7250299","resolution":{"observed_at":"2026-08-07T23:18:40.193451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.196466Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.196466Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:bbb4fca1d2175a9047970f35aaeebe1496aac979bf6b4469e083866be36a82c4","observation_id":"70fe3b7b-f63f-46f8-ab25-0070b9bc4792","resolution":{"observed_at":"2026-08-07T23:18:40.196466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.200063Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.200063Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:db5d6eecd44ebbec56c551c1a9ce6549c47ce11bedbc722d371386040dfc47f1","observation_id":"2cc8016c-02b9-41da-a29a-b5e2a5431e7a","resolution":{"observed_at":"2026-08-07T23:18:40.200063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T23:18:40.204091Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.204091Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:6c41084d40ad66794a687a7b6516142ef850ba8043aceb9a375968443d5f0516","observation_id":"903318f1-9c08-4bdf-8239-36e367371e71","resolution":{"observed_at":"2026-08-07T23:18:40.204091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.284407Z","title":"Loose lips sink ships: Mitigating length bias in reinforcement learning from human feedback","venue":null,"work_id":"0ce547b5-9464-42eb-b10a-7eecf6a788b2","year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.207167Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:548eb942a8374ad28d8d4ed57f20347d46d83c40ab7410328a0dda95902fe9df","observation_id":"17deff01-442c-461d-9e67-b0f3dc9307cc","resolution":{"observed_at":"2026-08-07T23:18:41.288557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-13T18:58:52.179453Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T23:18:40.210360Z","title":"A long way to go: Investigating length correlations in rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.210360Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:e4e06038e05d5e01f60b5409c4fc89555c2af3336840f580b9e3c44d0a1fd21a","observation_id":"7f7c52d3-b3d6-435b-9a49-90fde801f122","resolution":{"observed_at":"2026-08-07T23:18:40.210360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.214834Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.214834Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:fe95ad36d16f05e9856e2736a95945121b4b59027355fce685ec78633f4d710a","observation_id":"25f07d7e-6a95-4b3b-ac2c-c14c9fdce18b","resolution":{"observed_at":"2026-08-07T23:18:40.214834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.218076Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.218076Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:b42ab5260abdcec2f6a9e78b783b466c244259e5cf3d07b8b2bc39a70ad515ee","observation_id":"530e25d9-8427-48e0-b08e-4145d69cc392","resolution":{"observed_at":"2026-08-07T23:18:40.218076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-13T10:48:54.433250Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-07T23:18:40.221309Z","title":"Aligning large language models with human: A survey, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.221309Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:f5d773a5137fc0227e5e428813fff9398d0eb3ddf214b91159957559e8675703","observation_id":"88a9ef1a-fdf6-43df-9a9a-48aa06193a4e","resolution":{"observed_at":"2026-08-07T23:18:40.221309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12735","last_updated":"2025-04-26T15:42:47Z","snapshot_observed_at":"2026-08-13T15:10:40.775592Z","submitted_at":"2024-10-16T16:51:01Z","title":"CREAM: Consistency Regularized Self-Rewarding Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12735","snapshot_observed_at":"2026-08-07T23:18:40.224406Z","title":"Cream: Consistency regularized self-rewarding language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.224406Z"},"links":{"cited_paper":"/paper/2410.12735","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:157bcf44c76fd21154fabbb33b87d0a8d1a56a596222d4304e13ab81375318cb","observation_id":"7164f128-cdf4-44ef-91c6-d7204eaa7eed","resolution":{"observed_at":"2026-08-07T23:18:40.224406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-12T23:13:18.025785Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-07T23:18:40.227467Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.227467Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:bafa8d7d115b34c4e2ff6bf2ac283ee968d238b3ed68547070699afdacd9dca8","observation_id":"45ba3edd-7f76-45ac-9694-d4a798e03727","resolution":{"observed_at":"2026-08-07T23:18:40.227467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.266269Z","title":"Unsupervised data augmentation for consistency training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.266269Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:d00c2baefb6ff1026fff47f3ca858403af8874a56eca3b7f88e30ba822f97c1e","observation_id":"64166ff1-2b6d-4123-b172-19f7c6def6a6","resolution":{"observed_at":"2026-08-07T23:18:40.266269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-13T04:53:15.268224Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T23:18:40.316040Z","title":"Some things are more cringe than others: Iterative preference optimization with the pairwise cringe loss, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.316040Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:ba9126f339bbcee50d37eb1306e2d275b852d37b2436cf814de1191a92cec186","observation_id":"598702dc-9791-4f54-a428-300b670adccc","resolution":{"observed_at":"2026-08-07T23:18:40.316040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.252487Z","title":"Y., Cho, K., Li, X., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":"507a8ce8-ff5a-4954-829c-27360abe1dde","year":null},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.357141Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:ee74e398c84eff4a714c61bfe5204a4ae6c84dc3c2d292b007aafe0f9e1effae","observation_id":"b18fa00a-7ce2-4f66-b358-f64b253c7e37","resolution":{"observed_at":"2026-08-07T23:18:41.257658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.154798Z","title":"Consistency regularization for cross-lingual fine-tuning","venue":null,"work_id":"d74cf23f-20c1-490a-8b45-d9228afb4f72","year":2021},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.378764Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:ebc14393c642cf21ef46f1d6e03e24cf231e1085049c1d66064a61d2cf6e8906","observation_id":"99baab46-c283-4db2-bea8-20b2703cc36e","resolution":{"observed_at":"2026-08-07T23:18:41.210130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:41.018721Z","title":"E., and Stoica, I","venue":null,"work_id":"21978a29-deeb-40bf-b94f-79e418b26c73","year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.382175Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:793eb7dd6fdafae4e202ac244ff6d320329cd7312af8d881d98ffa6c78630465","observation_id":"e33d1246-26e6-4c54-b606-ade210b624df","resolution":{"observed_at":"2026-08-07T23:18:41.083420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T23:18:40.385881Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.385881Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:4257444476e09d7f1981ad81de513a7d0b4337725e1b8fdd3e5bbedc2ad3bc49","observation_id":"176818cb-b9d0-4c68-8670-6542311d105e","resolution":{"observed_at":"2026-08-07T23:18:40.385881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.934445Z","title":"Lima: Less is more for alignment, 2023","venue":null,"work_id":"dff357f1-eac1-4d52-8a9d-48144cfab851","year":2023},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.390304Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:a86a5790d3079b8bf1e535379410d1e092329b1efa8902073382669ca221582c","observation_id":"4cb36be4-555d-4d63-b195-7f4f991998b5","resolution":{"observed_at":"2026-08-07T23:18:40.949771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:18:40.394477Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T23:18:40.394477Z"},"links":{"citing_paper":"/paper/2502.08922"},"observation_digest":"sha256:d70f6d43c931468550c22ab7bf47056b8431f81858bfd73ee5cee14513545225","observation_id":"c8fedeb3-353b-4ef0-a942-1cd7d86361a2","resolution":{"observed_at":"2026-08-07T23:18:40.394477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T04:56:24.796449Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 4 inbound Pith citation observations for arXiv:2502.08922."}