{"as_of":"2026-08-17T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab49591e226e2d2bba347e85a8e1965cb9d0040bf5be5f4e7de23840f6ddd98a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:53:39.945503Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06292/citation-record","integrity":"/paper/2506.06292/integrity","json":"/paper/2506.06292/citation-record.json","paper":"/paper/2506.06292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:41.247917Z","title":null,"venue":null,"work_id":"f34ca0e0-18e9-4fe6-ab72-5a902551f7e7","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.302069Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:84ba84c6a22ddb8040cca307089ba53708c19d10992607105a7e95d857296c19","observation_id":"0e259bdb-1853-4f76-84aa-ec5ff05cb212","resolution":{"observed_at":"2026-08-15T20:53:41.252199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:41.169172Z","title":null,"venue":null,"work_id":"5544f2f3-7bdf-406e-b51e-d88ac05174dd","year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.329015Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:6e2a0302162438540106f5dcad5eacf392103d1bfccf2acb42df572f59609377","observation_id":"59f42dc6-7d9c-4be1-adc3-97899f90b612","resolution":{"observed_at":"2026-08-15T20:53:41.220394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:41.156963Z","title":null,"venue":null,"work_id":"122bc019-283b-4264-b511-caa395380007","year":1952},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.334587Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:7de226bcce0aa1680f524b4661a9825b386576cc8f888f7e0763c07c81dbd210","observation_id":"f3f9575d-4960-4351-974b-6d1dd7ddc3d3","resolution":{"observed_at":"2026-08-15T20:53:41.161019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:41.143640Z","title":null,"venue":null,"work_id":"111d019d-54bf-4803-9ee3-adfd98ae17e8","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.339235Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:2240d4715f0a872a2e85f205e0bda8312e000cae2be51177818122b6820b0de2","observation_id":"978bf97d-65b1-438b-94a4-ab59511d346a","resolution":{"observed_at":"2026-08-15T20:53:41.148198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:41.128923Z","title":null,"venue":null,"work_id":"e05a7c54-8fec-4c8b-a2d8-4a436bb248cf","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.343889Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:704085d98afe44b745b16d91a4d3db8066ede3daf745aae6f7d64dbede92aca0","observation_id":"a1381f10-04b2-4af2-ae1a-e2b5632dedf6","resolution":{"observed_at":"2026-08-15T20:53:41.132737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T20:53:39.400888Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.400888Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:73baf9a6259deb01069866f5131e4e0b993f0df586aa42046e4b30361539b481","observation_id":"8a67c46b-6cbb-4da8-906c-726a865b6ef7","resolution":{"observed_at":"2026-08-15T20:53:39.400888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:41.053964Z","title":null,"venue":null,"work_id":"7ee46af3-8f42-4328-8f58-8f2682bbe68c","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.457730Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:8992a647c92efc3b01f480f928e6b81b419e5ad749906fa630da34c03bb1e6b4","observation_id":"4a44d61a-c70d-4648-b021-b38faf6ebac7","resolution":{"observed_at":"2026-08-15T20:53:41.101716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.929072Z","title":null,"venue":null,"work_id":"8db8fdd7-5f98-437f-9f0f-976c3d110da6","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.463308Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:d8e064d977aa4cdfa63acec5f6a2b3ee6ef58dd3cf264fc4e88bdd7709e7cb9e","observation_id":"28b5ae49-fd87-46da-a06b-728da4083026","resolution":{"observed_at":"2026-08-15T20:53:40.967376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:53:39.467713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.467713Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:51486b76101f47820d921551d8e2643da90049d285a1c8d9f1cc5d0f392cec99","observation_id":"b71dc55c-33ca-4308-a853-269496bca3d3","resolution":{"observed_at":"2026-08-15T20:53:39.467713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.914885Z","title":null,"venue":null,"work_id":"5bb52ee1-0016-4ab0-8cec-af47b2531458","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.510979Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:3783c784155cc2712fad8ac30c54c7fedd15623ea58b03295633ba653b654aaf","observation_id":"d1e7c4d8-2c34-497f-b0bb-7a57312fd4e4","resolution":{"observed_at":"2026-08-15T20:53:40.919735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.901055Z","title":null,"venue":null,"work_id":"7797c885-ae1b-4f1e-855d-5f9bbe37ab1f","year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.550477Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:17ed983f5f2d275fdb081158d4d75d305a6192f9bebf4bd26d69bcc9a648c5cd","observation_id":"b7c67607-e814-42c0-a8e0-af4837770113","resolution":{"observed_at":"2026-08-15T20:53:40.905940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.556303Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.556303Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:39eb861b4a4110c77c2a20016e0b158052c0614e477dfe766d50a36f3798fbfd","observation_id":"d5103b4b-4463-4aac-b4bd-6b3cdf90c96a","resolution":{"observed_at":"2026-08-15T20:53:39.556303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03649","last_updated":"2022-08-22T08:45:33Z","snapshot_observed_at":"2026-08-16T17:08:29.314804Z","submitted_at":"2022-04-07T17:59:57Z","title":"Unsupervised Prompt Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03649","snapshot_observed_at":"2026-08-15T20:53:39.560608Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.560608Z"},"links":{"cited_paper":"/paper/2204.03649","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:1fab6eee40f96047af022c6e9c46fa398812c09b01d9d8063aa2fe7b5200d2c6","observation_id":"e33448f0-f078-42fc-90be-c542b2e24317","resolution":{"observed_at":"2026-08-15T20:53:39.560608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T20:53:39.565940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.565940Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:c564a7b9d8a44db5630db1a53a2d284cf3fda477433eec4a9dbaef44108434e7","observation_id":"d8b4b98e-2343-4dd3-9aa1-d6aa3620b9c0","resolution":{"observed_at":"2026-08-15T20:53:39.565940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.815238Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":"968b0567-9a7f-4440-87b7-3faa247a11ef","year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.586857Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:9d4d75f8d6236433ea2e89c416a8847cab281af077d81a7daf2b4c7ed3d3cfd2","observation_id":"8d8c6a49-c328-42d9-9f32-12d33108a241","resolution":{"observed_at":"2026-08-15T20:53:40.861856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-17T18:23:08.323051Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-15T20:53:39.618730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.618730Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:7830751cb9deb6179386c4fc4e6005c1d7bfe399a835848289e75c35258c3d4a","observation_id":"fd313a3d-62f6-4ce5-91a2-395096329e06","resolution":{"observed_at":"2026-08-15T20:53:39.618730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-15T20:53:39.623147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.623147Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:ea0068bbb027260843bf1d935085655299b19f237f7a01386250dd854ea44116","observation_id":"20ca02fc-c8ee-4bf9-8bcc-1864ceaa277b","resolution":{"observed_at":"2026-08-15T20:53:39.623147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.628011Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.628011Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:7ef048bd88fc16675430c6b2b09eff1f0729d548d9a53991de476c52a5869206","observation_id":"fe9c420a-51b0-48a4-98f5-93beab23e59e","resolution":{"observed_at":"2026-08-15T20:53:39.628011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.632014Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.632014Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:b10d4913db4263acf4f43c6e474107a643580f5c8238dc187078b272c3fea01d","observation_id":"46282fff-87fd-41ac-8404-771df9e80b75","resolution":{"observed_at":"2026-08-15T20:53:39.632014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.670251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.670251Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:26a387b22e790ac01649eea7334d7ad51346c74ff30ea597a55760a581f53acc","observation_id":"277eeee6-42be-4398-a7f1-b5a2eb80f71b","resolution":{"observed_at":"2026-08-15T20:53:39.670251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.684813Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.684813Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:ab987feadfbdc3cb0a0562b124a771bdad06706064e7239c79842e59715fe429","observation_id":"d01e6eb2-b3b3-4777-bf7b-e3e8ad51cf25","resolution":{"observed_at":"2026-08-15T20:53:39.684813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12086","last_updated":"2024-10-25T12:04:26Z","snapshot_observed_at":"2026-08-16T14:25:30.460328Z","submitted_at":"2024-01-22T16:24:43Z","title":"West-of-N: Synthetic Preferences for Self-Improving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12086","snapshot_observed_at":"2026-08-15T20:53:39.688797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.688797Z"},"links":{"cited_paper":"/paper/2401.12086","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:079646965927794c03880212fea9e234f8de63d491889c01223ebac71b40d52f","observation_id":"50a0298e-512c-4696-87af-53bfcd238469","resolution":{"observed_at":"2026-08-15T20:53:39.688797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.760161Z","title":null,"venue":null,"work_id":"6812e1e0-197c-4236-9788-3ec151d12dc4","year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.693626Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:7f44fa4338b10db42460b81e9541c5cf793143f979f72ac84eef5973db4eac42","observation_id":"b4c6a41b-b39b-428f-b89d-50d428430fdd","resolution":{"observed_at":"2026-08-15T20:53:40.765235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-17T02:24:53.749690Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-15T20:53:39.697397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.697397Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:57dd85080dabe1b8097582c22ddc6e9de0c9a75d60852b74c84a196ddc475858","observation_id":"ca2ed841-9dfc-4063-acfe-bf54bb93437f","resolution":{"observed_at":"2026-08-15T20:53:39.697397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:53:39.745017Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.745017Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:a588a924486a206740882feca282c78ea300a4c3ff526fed587d4adae916217c","observation_id":"da4f1290-f09a-4fd8-bc74-bc7fb255912a","resolution":{"observed_at":"2026-08-15T20:53:39.745017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.745858Z","title":null,"venue":null,"work_id":"15436cda-0015-424d-be30-f2087dab1ee8","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.758841Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:d29305072992da67160bc0a89f8afcd2fc53b0b671da7f114894140ebe2154f1","observation_id":"950088f6-7ef1-41a3-b947-585f9315510d","resolution":{"observed_at":"2026-08-15T20:53:40.750998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:53:39.764028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.764028Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:7c1cd6d11888adf4b2c26f5c55d7438ca42539ca937a464466ab8d0ee3a0325a","observation_id":"a06adbd8-8925-4aa7-8c30-88739ff09d19","resolution":{"observed_at":"2026-08-15T20:53:39.764028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-15T20:53:39.769219Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.769219Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:f402ab8e027e05323e9e630d6c95d90978e5ed9f532ff8994435657fc88559b0","observation_id":"5becf1b0-5333-47e0-a261-560c85222f6e","resolution":{"observed_at":"2026-08-15T20:53:39.769219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.657814Z","title":null,"venue":null,"work_id":"59f0f7b2-772b-4454-9a38-85be20254894","year":2025},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.773480Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:d7ab5221788740a6d64b41efdc1a9a1edd6eb29bd007621212d007a42ce4f661","observation_id":"54dcd746-5496-46ad-907d-1bc06e1664b6","resolution":{"observed_at":"2026-08-15T20:53:40.721762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.645684Z","title":null,"venue":null,"work_id":"295bc23f-c26d-44c8-b3ea-70791609528f","year":2025},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.804455Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:2510bc92c382fe57dadb990808a0e80dc88357466fe0e69df0aa903ba1099c72","observation_id":"c370cb21-0787-42ff-85a4-5c6ca7a02d41","resolution":{"observed_at":"2026-08-15T20:53:40.649631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.630858Z","title":null,"venue":null,"work_id":"4879879f-712b-4fef-8de7-55b0c982d8d8","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.821265Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:46f45960fbd48e3caaed0dad8e7d07bb4c1a598c039138511223d96ac3758478","observation_id":"56ba907a-9370-4dd8-a591-d43550b8194e","resolution":{"observed_at":"2026-08-15T20:53:40.635594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-16T14:31:20.852372Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-15T20:53:39.825287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.825287Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:da9669d541b0e9647349f4ed770a5ca514c472b3129b27b932ab3ce72438178a","observation_id":"65e4bd1c-ee79-473c-bd2b-5549e6116acf","resolution":{"observed_at":"2026-08-15T20:53:39.825287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.487168Z","title":null,"venue":null,"work_id":"4fa7cd15-e818-43b8-b385-71447949a10c","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.830032Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:5004f0659f74344aca710442e9559d4abde97488909657215f17b89f005d04ec","observation_id":"570ee809-c4ba-4efc-ad84-de2f1b6863cd","resolution":{"observed_at":"2026-08-15T20:53:40.552162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.474396Z","title":null,"venue":null,"work_id":"0ab1b5f9-ac64-4955-bd3d-0ac18b80d2f9","year":2019},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.833947Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:187533e6af068f38c82ac4416e4c6ab4e1ae820232e43adaf865f02f30b715e0","observation_id":"6c4a7e11-e3a4-46cf-8633-c45d1a077b12","resolution":{"observed_at":"2026-08-15T20:53:40.479115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.383721Z","title":null,"venue":null,"work_id":"7188ccb5-a25f-47e7-b141-b7219b62e234","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.869192Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:03d9d99935148129b5e2cbd87634b53a67c00410deecea88c219b12ef83e0671","observation_id":"fdaae8eb-a5b5-4938-ab43-48aa74c9bcf8","resolution":{"observed_at":"2026-08-15T20:53:40.464775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-08-16T13:48:06.116170Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-15T20:53:39.902673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.902673Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:12f2e4527891d97c607868e134aaf4ae93ea1c9037ff9210e16fdb2835bca9aa","observation_id":"6247927f-d8b1-4abb-a09b-43bc9f775eb8","resolution":{"observed_at":"2026-08-15T20:53:39.902673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.302768Z","title":null,"venue":null,"work_id":"ef87c55b-3d75-4c69-bf88-7596425e6003","year":2023},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.906790Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:e5bd8ecbe96c2d1c96977abdd43b543afc7fe77cfe38c34ce731b6732c6bb6c0","observation_id":"1935e351-7c0b-4431-828e-425bf210485d","resolution":{"observed_at":"2026-08-15T20:53:40.307258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:40.160760Z","title":null,"venue":null,"work_id":"6e806391-fac0-4d80-8abf-d61f3e437139","year":2024},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.910135Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:b328d4b5e764789b4837be3a672d5f8e147ce80475dc8691d04b93bd8867bf3b","observation_id":"20027d6c-b0f4-4dca-96a2-aa95bbc23a91","resolution":{"observed_at":"2026-08-15T20:53:40.227908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.914465Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.914465Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:241f4f45c4de6a08bca7b05653ff36cdae01cc155d90c792e336fd523c028075","observation_id":"05910a02-702f-4b74-91d3-591b3c2acc1d","resolution":{"observed_at":"2026-08-15T20:53:39.914465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:53:39.945503Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:53:39.945503Z"},"links":{"citing_paper":"/paper/2506.06292"},"observation_digest":"sha256:b5458a4259ff2fd67c5ecd6080d8fe4ff3b47f96dd193f5c0c8def19bbea0328","observation_id":"96265a0b-a2e8-4105-8ca1-1e62070ec375","resolution":{"observed_at":"2026-08-15T20:53:39.945503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06292","last_updated":"2025-06-10T03:32:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T15:10:40.216361Z","submitted_at":"2025-05-17T04:34:23Z","title":"Mutual-Taught for Co-adapting Policy and Reward Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.06292."}