{"as_of":"2026-08-18T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56e358fd55592e686bc67ee00cafde1abfbf7e4660a9e0b196da0ee4a9b19d07","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:40:09.533305Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:29:18.049711Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:07:56.781634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":"2504.20157","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7dbe72ba-e72c-46f3-b595-ea3ff2094d96","year":2025},"citing_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:56.678339Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2507.17746"},"observation_digest":"sha256:be07811e32187d4ffc278092267aa80f56c2ac5ed7ef9a444e56eec4fa1e0ab2","observation_id":"4a11841a-1d3f-494b-b92f-976e3a3625a3","resolution":{"observed_at":"2026-05-13T06:07:56.785000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-07-31T23:52:09.180660Z","title":"arXiv preprint arXiv:2504.20157 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23333","last_updated":"2026-07-25T19:11:15Z","snapshot_observed_at":"2026-08-03T00:37:21.399146Z","submitted_at":"2026-07-25T19:11:15Z","title":"Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex","version":1},"reference_index":222,"source":"arxiv_source","source_observed_at":"2026-07-31T23:52:09.180660Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2607.23333"},"observation_digest":"sha256:2651059803c25f8456600bf3c289da75ce4edc548e47445d4a24c70872ab48d7","observation_id":"514714e3-6952-4251-a15e-d7d09cae203f","resolution":{"observed_at":"2026-07-31T23:52:09.180660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-08-14T04:29:18.049711Z","title":"Toward evaluative thinking: Meta policy optimization with evolving reward models.arXiv preprint arXiv:2504.20157, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-14T16:52:27Z","snapshot_observed_at":"2026-08-18T23:13:08.392070Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.049711Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:4236a39fef6394d949d78cbf88fb29edd2a153a6ca65b63a27e6ebf8bc21d34d","observation_id":"7112acee-2383-4d63-9ac7-fbb30715048d","resolution":{"observed_at":"2026-08-14T04:29:18.049711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20157/citation-record","integrity":"/paper/2504.20157/integrity","json":"/paper/2504.20157/citation-record.json","paper":"/paper/2504.20157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.128421Z","title":"Ahmadian, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.128421Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:4b466639443a4d53b9576ac3da05f5953fb258c8a6db100e7c8ef55759ebf358","observation_id":"84014ee3-0a43-46f5-b326-d6970b87b155","resolution":{"observed_at":"2026-08-16T05:40:09.128421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.879218Z","title":"Amodei, C","venue":null,"work_id":"806fd1fd-6ffe-4490-bee4-92181ed46358","year":2016},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.135897Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:a437517c24e414393cc5a921c3f69adde274ab3283cfea3e1208239acdee5ee0","observation_id":"4306b0ca-f5f8-4992-8f57-d901d427a5b4","resolution":{"observed_at":"2026-08-16T05:40:10.884168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T05:40:09.141124Z","title":"Amodei, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.141124Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:932f5235bce813e9377383b66143cc2dbaf132bdb62b0026a5774883ee2330d0","observation_id":"a224da52-802f-42ba-b81f-db6ed05552aa","resolution":{"observed_at":"2026-08-16T05:40:09.141124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T05:40:09.146832Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.146832Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e51b153d8f273f6a3296abe9bd18ce53fac8cb151605ac0ad3579faa5109242c","observation_id":"556e3ce8-83e2-4569-969f-8804d3cc9109","resolution":{"observed_at":"2026-08-16T05:40:09.146832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.863327Z","title":"Buckley, T","venue":null,"work_id":"9ffe2eb8-8dd5-4538-998d-26e2c0c14520","year":2015},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.152614Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:2790237da4c7cf8286b59b4797a83110e1189182f7a1a1176510d11ed0ebfdf8","observation_id":"10bd2885-16aa-4cf9-9b8a-fa048e6f08a9","resolution":{"observed_at":"2026-08-16T05:40:10.868225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07319","last_updated":"2024-02-11T22:40:12Z","snapshot_observed_at":"2026-08-16T14:19:30.130925Z","submitted_at":"2024-02-11T22:40:12Z","title":"ODIN: Disentangled Reward Mitigates Hacking in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07319","snapshot_observed_at":"2026-08-16T05:40:09.158251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.158251Z"},"links":{"cited_paper":"/paper/2402.07319","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:18335fad99c51555ac5e267f3d185715b991038f6b51fb26995b68675ba3132c","observation_id":"91c60746-0dce-4ca3-a41b-b26db3800892","resolution":{"observed_at":"2026-08-16T05:40:09.158251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.847587Z","title":null,"venue":null,"work_id":"32fce83c-6c9a-4a6b-9ed6-53c4e68f3df4","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.164194Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:fb9163f81badcabe2b55667e5de173328ca89d79a45ce4ca22267b77462305b6","observation_id":"ae0345da-19bc-4bd4-81e0-f040ef5bffa9","resolution":{"observed_at":"2026-08-16T05:40:10.852486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-16T05:40:09.169269Z","title":"Chiang, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.169269Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:7287ae7749e850dc0f88906568530e62728f3a3c6b8cd1db057d638836170804","observation_id":"50b31a4f-c1f1-43c9-a793-b8ba75fb26f4","resolution":{"observed_at":"2026-08-16T05:40:09.169269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.831375Z","title":"Coste, U","venue":null,"work_id":"8d075fc1-0c9c-4a17-b69a-ebb5619237b6","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.174620Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b0947a6c01a3ccbd5a6d3fbbdfa36d091a9462b930d4d9df717b42fad54e6da3","observation_id":"32ef45af-468c-4eac-8426-7e477df43f2b","resolution":{"observed_at":"2026-08-16T05:40:10.836698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.815777Z","title":null,"venue":null,"work_id":"5a7882ab-6637-48d7-9f4b-63ff33e34073","year":1971},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.179775Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:3734a3b0e33b3d2023447c4ecfa2290af95a0d6eb5583302b20f25cbc7db47ed","observation_id":"836b619c-f099-4806-bf18-aa63d08c53d9","resolution":{"observed_at":"2026-08-16T05:40:10.820404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T05:40:09.184730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.184730Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:34cd70f5ccb8780a203959165a040f1419ef4b6cc158131ac72ede379ea82421","observation_id":"ae088c77-19a0-410f-835a-817d8ce11952","resolution":{"observed_at":"2026-08-16T05:40:09.184730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-08-18T14:49:13.384384Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-16T05:40:09.189989Z","title":"Denison, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.189989Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:4620d1359eafd90faf57aacdddb4d9247d2d8038c77f7ae401dd0ce9b0c4267d","observation_id":"66984877-6b63-4282-ba84-e1fa7d93d77a","resolution":{"observed_at":"2026-08-16T05:40:09.189989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.799758Z","title":null,"venue":null,"work_id":"87839079-57a7-48c9-a40d-848e6262df41","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.195069Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:aa10c9e5a8552850e7d57f7e45762fd3bc770728e50c1079ea461b590aa094af","observation_id":"192bcb4f-0014-4344-86d5-96a3f0016df2","resolution":{"observed_at":"2026-08-16T05:40:10.804793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.783933Z","title":"Efklides","venue":null,"work_id":"8d4fa2db-dc87-43b2-8e34-9e70f9302f3b","year":2006},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.199747Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:834546797247e328d267deb855d5dd8fea5f788b14c55af7205f04593155c73a","observation_id":"f2d9a440-6136-4c47-9383-4967c4f8086f","resolution":{"observed_at":"2026-08-16T05:40:10.788673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.766903Z","title":"Eisenstein, C","venue":null,"work_id":"2cb49555-e91f-4bc5-950e-836b37ec3995","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.204248Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5aeab19f69df5f420087641640ba0a254d5ed31af7e15c2a2ed728f77f2d6c5b","observation_id":"e1af0d2c-812f-41fd-9a01-dd322fcab31e","resolution":{"observed_at":"2026-08-16T05:40:10.772380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-16T05:40:09.208936Z","title":"Ethayarajh, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.208936Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:c9da3495a17fbc76e57f447a2e909d4f658f96aea7df24fedfd7c619d6f17e60","observation_id":"f4431f81-cd12-44f6-bb02-e79f62bbd885","resolution":{"observed_at":"2026-08-16T05:40:09.208936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.749605Z","title":"Everitt, M","venue":null,"work_id":"af73bb33-f210-43c6-824e-0a28a85f17a4","year":2021},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.213859Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:1b54f910e49201c04132555ecc793344887a67fb985c642f908ccd346cd61d41","observation_id":"d57dbda2-dc2e-4c8b-8c38-bf3675930d1a","resolution":{"observed_at":"2026-08-16T05:40:10.754664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.733302Z","title":null,"venue":null,"work_id":"0b8faf73-2f2c-474d-8411-aa14bfdaf87d","year":1979},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.219104Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:0fb6a42230339247a226e5f4141e6250c7c9fa28b6353ce752d9b4c5674b6f45","observation_id":"69bd380b-f029-45cd-b87c-8e663f6923cc","resolution":{"observed_at":"2026-08-16T05:40:10.738502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15753","last_updated":"2025-07-08T16:17:15Z","snapshot_observed_at":"2026-08-16T13:40:33.758636Z","submitted_at":"2024-06-22T06:43:51Z","title":"The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15753","snapshot_observed_at":"2026-08-16T05:40:09.223889Z","title":"Fluri, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.223889Z"},"links":{"cited_paper":"/paper/2406.15753","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:8810be04be7f7d3c6f3fb8e842161818b726c83ae39bc20f26ca45c218d9cdec","observation_id":"1088a2dc-d7d6-4b3d-aafb-dbb2db24837c","resolution":{"observed_at":"2026-08-16T05:40:09.223889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-13T18:34:28.304602Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-16T05:40:09.228950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.228950Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:dc04b9c3a4ebd18f36d83761030d8159c8f4a76b887e4377dc720edd2b3e4497","observation_id":"622f78c8-129d-48ff-a38f-179609261787","resolution":{"observed_at":"2026-08-16T05:40:09.228950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.717422Z","title":null,"venue":null,"work_id":"3984b20e-a10d-4b65-92e5-6bf80b55c3af","year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.233843Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:c94cdadc4063f87106853fe00e3f3e5cb6742d040d286a393b119a44ffedb739","observation_id":"8c964a05-3372-4c03-81cd-062246a087ae","resolution":{"observed_at":"2026-08-16T05:40:10.722228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.701092Z","title":"Hamner, J","venue":null,"work_id":"27455af0-a80a-4520-b8eb-42d91c73e639","year":2012},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.238853Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b7e241b08592741e03fb08d075adfe9636b9a4f935d6497a16b07078246b4c51","observation_id":"972e2a40-d167-4af7-9275-05ca3f9ee066","resolution":{"observed_at":"2026-08-16T05:40:10.706274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.684964Z","title":"Hendrycks, C","venue":null,"work_id":"6ebc57f2-312e-469c-8cdd-b4609eb9a2ca","year":2021},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.243702Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:562e9f23757e46f651b378cfd65c00486ba32e3f311c38c836102875047e5bc8","observation_id":"9a360b64-3cbf-43bd-8b13-02fa13c14d9c","resolution":{"observed_at":"2026-08-16T05:40:10.689981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.249327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.249327Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:1577c0af7c418886c4de0b434c7a3403b579e3c8a973aa8b7415dac2affb3270","observation_id":"4b777d64-80d6-4460-95d2-25b7b5664f22","resolution":{"observed_at":"2026-08-16T05:40:09.249327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.254238Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.254238Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:0016f39fb77b48f2f882cdaa8212aac38d344e0223d9ee363191d96d85a55644","observation_id":"4d4d5521-3aff-4dd4-b14c-0c29b73a4b73","resolution":{"observed_at":"2026-08-16T05:40:09.254238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.259920Z","title":"Kornilova and V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.259920Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:feefd72911d381c32ea4082adc00577ff65abbf8b380f895f0d67a3a8dd45bf4","observation_id":"a1ad9198-c9d1-4078-ab47-40aee5bc693b","resolution":{"observed_at":"2026-08-16T05:40:09.259920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.265135Z","title":"Krakovna, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.265135Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b9ba0825adc151456e2aa2f968791a4ef11f308d1818892277251506c4c94156","observation_id":"f38cfb96-0bc9-4eea-a2aa-15bd1d42b31b","resolution":{"observed_at":"2026-08-16T05:40:09.265135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.658221Z","title":null,"venue":null,"work_id":"14b29930-516f-458f-ba7e-622140245581","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.270126Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:cbb16ea84220b988f4347b946d479478475ef9a95856ca690afb836b62de9f3f","observation_id":"433df192-df45-420f-9bb0-346297af1b6e","resolution":{"observed_at":"2026-08-16T05:40:10.663066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.641766Z","title":null,"venue":null,"work_id":"f3300476-4586-40ca-a949-5077971211aa","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.274936Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:9863ea7607eec5caa75c701efcae94cb5081b8cef3527946602bc265180731a7","observation_id":"5f8948f6-c1b9-43c5-a354-fc31c7dbf8ca","resolution":{"observed_at":"2026-08-16T05:40:10.647596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.284787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.284787Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:2e1a8b17be6c1b2d4d377159439a10916e445176be15c9f292fba3ef65a01b8e","observation_id":"65d092b0-0a66-4b03-80bc-38d1630052be","resolution":{"observed_at":"2026-08-16T05:40:09.284787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.615087Z","title":null,"venue":null,"work_id":"3234d5b2-a7d0-4e6b-bf76-3d746da36798","year":2004},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.289547Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:dc24dc107f501ee92aa8b3574ff6954a23a82f9cb8f35edd780d8644a110f075","observation_id":"5fb6f3bd-3dd9-4bce-8e61-4dd24a6dfc98","resolution":{"observed_at":"2026-08-16T05:40:10.619821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.599551Z","title":null,"venue":null,"work_id":"57b9f932-d327-4dd4-8510-dd39e822cf0f","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.294328Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:465699a72e8c221fe7b98d1e0b39bd52b693d521dd68db7a5c097e8829dee184","observation_id":"2b6b871e-def0-4485-8e08-94be64156b19","resolution":{"observed_at":"2026-08-16T05:40:10.604313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-08-16T13:17:01.360159Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-16T05:40:09.300373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.300373Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:77c307d26deffbf2e7e56765f2d955d112ab1e7a7658d89a6efaad83d4166326","observation_id":"2a05bfa3-4df1-45af-a08b-56cb3225c0e6","resolution":{"observed_at":"2026-08-16T05:40:09.300373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.583152Z","title":null,"venue":null,"work_id":"b7fc7bb6-3896-4c2d-9f8f-80defb908ea9","year":1979},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.305542Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:9f2919c65e2d7b1330a97ddc2281a5b1199a557ebb78716debad7828f2e2c2d2","observation_id":"35f4bdc6-319e-43c5-9303-46afe503f3c0","resolution":{"observed_at":"2026-08-16T05:40:10.588317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.567765Z","title":"Lourie, R","venue":null,"work_id":"d7434535-74eb-4cf7-9a40-f45952108e2d","year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.310275Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:394d88a33f31202ca23ffb69e88ddd3ae0a29c1e91b4ec880afa86576e09654f","observation_id":"8facfa69-c929-44de-be2e-537ca11185c1","resolution":{"observed_at":"2026-08-16T05:40:10.572366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.551811Z","title":null,"venue":null,"work_id":"3dcf9c9b-6f3b-44c1-bc15-0768c006a34f","year":1987},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.315294Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:a76cc3886cd518e1e65583eb78860826841960ddf6eaabc80ca74b4abba90b21","observation_id":"a83fbe96-8807-4a2b-83df-d972bad9ed09","resolution":{"observed_at":"2026-08-16T05:40:10.556775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.535393Z","title":null,"venue":null,"work_id":"f5d46b66-aa3e-4106-b60a-0e61677e2915","year":2003},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.319942Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e7ac316d7e7a648eeffa90425012137f3e0b76cdbd3874fb757d105a8e1d0afd","observation_id":"a9e4a206-746d-4a89-bc50-5f3bbb6f1d3e","resolution":{"observed_at":"2026-08-16T05:40:10.540436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.519219Z","title":null,"venue":null,"work_id":"7550f5fb-c920-4fd8-9db9-b04d46b5dc71","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.324685Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:8e88ec8bedab850cf1f0c01f395632c25772b35d3031d3fe65592e1479417e54","observation_id":"7b1aaf42-37b4-471c-ae6c-3b964cf90611","resolution":{"observed_at":"2026-08-16T05:40:10.524150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jml.2004.12.001","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.591791Z","title":"Metcalfe and N","venue":null,"work_id":"70e0b742-54ef-40b9-86ef-e7dbca658bfc","year":2005},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.329272Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5b73b32b030dabe8bf026d508f92f6c860472eb7f8881c6c58960f5dc5ffb524","observation_id":"527e7dc8-f5f6-4d90-8a32-520471788536","resolution":{"observed_at":"2026-08-16T05:40:09.598519Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.500573Z","title":null,"venue":null,"work_id":"b2dc2f41-860f-44c6-be14-d3590ad56917","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.334058Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:dd063e702d75c4de3932a56dd335dbe00bac18b1d8d0b0ad96fa0fb718ae5bab","observation_id":"a58260a0-9af0-45cf-8590-43ca5d4e1164","resolution":{"observed_at":"2026-08-16T05:40:10.506102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19358","last_updated":"2025-06-02T16:30:23Z","snapshot_observed_at":"2026-08-17T03:56:04.456325Z","submitted_at":"2025-01-31T18:10:53Z","title":"The Energy Loss Phenomenon in RLHF: A New Perspective on Mitigating Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19358","snapshot_observed_at":"2026-08-16T05:40:09.338975Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.338975Z"},"links":{"cited_paper":"/paper/2501.19358","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:9fd1f4706e5ee6bfc57f68afa07eb9b445c111abec743b549b0856283eec147c","observation_id":"2294f5e1-732b-40e7-910a-3e74daaa4d19","resolution":{"observed_at":"2026-08-16T05:40:09.338975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.483224Z","title":"Ouyang, J","venue":null,"work_id":"82cacae4-75dd-4528-a618-e1b1e5d70775","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.344202Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:0ba42ed86a6a33d30f301dae98693179b04f08d3c81a49c2ad96b5cba2e38b0c","observation_id":"68bc6e34-2ae4-4707-a5da-c381600b1957","resolution":{"observed_at":"2026-08-16T05:40:10.488096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.466559Z","title":"Ouyang, J","venue":null,"work_id":"21c35911-daf1-4d1e-8650-b184831a8330","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.349041Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:4adae783eaadda5088c070da57c92cb7506504f8abbc0eddf0df218821b68a74","observation_id":"1671728b-5791-4991-8af3-1404c6cb7c89","resolution":{"observed_at":"2026-08-16T05:40:10.471645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.449187Z","title":"Ouyang, J","venue":null,"work_id":"0deba0a3-5321-48ef-bbdc-ec78cc67f032","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.353973Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:95ef5f3cabd4ca0bd886498d9343dbafbf25d416467ada1fc6a850f877694b4f","observation_id":"b11e6543-9da9-4bbd-a492-8597831bab04","resolution":{"observed_at":"2026-08-16T05:40:10.454776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.432853Z","title":null,"venue":null,"work_id":"85a60c33-0e99-42c6-b603-7574aa10bbcd","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.358880Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e66feeb6c0f2a67f33b1b98a0e870205206bcb58910e4592bb8d532b568cca7f","observation_id":"bcb71774-95aa-431c-bfb5-00ae317dee4e","resolution":{"observed_at":"2026-08-16T05:40:10.437918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.363769Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.363769Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e54acf84451714de13587aa0e8863f18317c5386bf140cb58fd5fadc020b4226","observation_id":"b014d8c6-a3ac-4f19-95ae-579bfc4cf962","resolution":{"observed_at":"2026-08-16T05:40:09.363769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.417267Z","title":null,"venue":null,"work_id":"dc0b5eea-a9ce-4f0a-b25c-d12500b572be","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.369179Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e278ff521e3a41f7f2196f4e823e3127937ff434c4095dcbcefdcbc7e5a95fdf","observation_id":"cd4b6a38-51b6-4861-8ce8-b0683ac52398","resolution":{"observed_at":"2026-08-16T05:40:10.422198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-16T13:56:25.795152Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-16T05:40:09.374182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.374182Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:d5786e2b22ba6db3159c6308d908049136dd5e5df7bcc5f2d7c47ea31eeefc0d","observation_id":"cdf3ab89-eaf0-420f-a33d-d487e4804a56","resolution":{"observed_at":"2026-08-16T05:40:09.374182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18439","last_updated":"2025-07-12T20:13:27Z","snapshot_observed_at":"2026-08-16T12:55:16.151952Z","submitted_at":"2025-02-25T18:33:48Z","title":"MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18439","snapshot_observed_at":"2026-08-16T05:40:09.379491Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.379491Z"},"links":{"cited_paper":"/paper/2502.18439","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5cf62d4917dcb283df52066fbb5358a9c6d4d1c70fca9263353785151a8a451c","observation_id":"11df0c3d-e5ee-40f6-9677-7e0438431df9","resolution":{"observed_at":"2026-08-16T05:40:09.379491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.384702Z","title":"Perez, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.384702Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:370dd322f2b86591a462ebbeb13d526dcd46e2737508cb00cf6f26ffb601b498","observation_id":"b76ba7ae-bc15-47c3-ad44-1e5664272e99","resolution":{"observed_at":"2026-08-16T05:40:09.384702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T05:40:09.389446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.389446Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:3033a82bf7d37451086d9a3ebb8517f5fbdb06d84db0e9a7f2e04ca155a66a84","observation_id":"b0d625eb-b103-4a56-b950-355b7800b92d","resolution":{"observed_at":"2026-08-16T05:40:09.389446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.389752Z","title":null,"venue":null,"work_id":"caf75225-4ae5-4338-b59b-630a2198a923","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.394121Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:ff604cd0d631c86c21415e3e3639286e8c559f4e774bd62e7533713faffd0dad","observation_id":"8b2ac55e-fa62-4471-a7a6-955281384036","resolution":{"observed_at":"2026-08-16T05:40:10.394787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18099","last_updated":"2025-07-08T09:49:57Z","snapshot_observed_at":"2026-08-17T07:00:12.389328Z","submitted_at":"2025-01-30T02:21:59Z","title":"Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18099","snapshot_observed_at":"2026-08-16T05:40:09.399353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.399353Z"},"links":{"cited_paper":"/paper/2501.18099","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:2223f66d9da9b8af3cada4a7abbcb5b1023a940a806f2a0f7dd23274a3257b12","observation_id":"ce64f43f-f56f-4ceb-a41b-946b213c5fc1","resolution":{"observed_at":"2026-08-16T05:40:09.399353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10076","last_updated":"2023-10-16T05:19:02Z","snapshot_observed_at":"2026-08-16T14:51:54.448036Z","submitted_at":"2023-10-16T05:19:02Z","title":"Verbosity Bias in Preference Labeling by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10076","snapshot_observed_at":"2026-08-16T05:40:09.404427Z","title":"Saito, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.404427Z"},"links":{"cited_paper":"/paper/2310.10076","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:35a1cdb0c42b4e77747fe25250b3f686e59d0a6c373f4036a2af1161d991352c","observation_id":"9ac2ff3d-b2bc-488d-a9f0-6c7e6e41f189","resolution":{"observed_at":"2026-08-16T05:40:09.404427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T05:40:09.414460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.414460Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b3639fa6773c6baf6cf646e1283d47ff79f2a7c9b0e556a07c6172936670f82a","observation_id":"1ffa1d05-eec1-4e60-afd8-78932d7724dc","resolution":{"observed_at":"2026-08-16T05:40:09.414460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.373349Z","title":"Sharma, M","venue":null,"work_id":"5b2cbf3c-c801-4a44-a979-f4801219d70a","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.419402Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:25ae5eac7910c000961e788620ee64a47a54b5c6f4553104b979257476c11f7a","observation_id":"945a2281-cd88-478f-a281-cabf37e7366b","resolution":{"observed_at":"2026-08-16T05:40:10.378237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.355725Z","title":"Singhal, T","venue":null,"work_id":"df1ad410-c4b3-4aa8-a5a3-cc3ef04bb7f4","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.424140Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:1a86809488f0d47dca6a2f5a7a6813f0cd27d0d5af6a937e11490bc557d4bdc1","observation_id":"0af90142-28ef-42f0-af13-5cf3c4d47bfc","resolution":{"observed_at":"2026-08-16T05:40:10.361213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.335986Z","title":null,"venue":null,"work_id":"486d83b5-b056-4801-bceb-7cab163710f6","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.429286Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f5a01b378af8dd53bee8ce360af070c0ed3c1f915c697e4bf69b2127fceb6836","observation_id":"e811439f-75ea-4476-9b60-b3b631382a62","resolution":{"observed_at":"2026-08-16T05:40:10.342362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.318755Z","title":"Stiennon, L","venue":null,"work_id":"e1d5ccaa-772f-4565-8eb6-4dff8ebee67a","year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.434243Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:61a99c117437d918042fb32afef9762e6c0dbb41ddee51ddae17fa8b0271f177","observation_id":"22eb0913-acdf-4a0e-b0da-3ae9645d77bd","resolution":{"observed_at":"2026-08-16T05:40:10.324517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.301559Z","title":null,"venue":null,"work_id":"5f72744e-c865-4579-8c58-80077d02ffa8","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.439183Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:2140e6e599bea17469e6cd8b4b3a78ecc0a8452719dc5a7e0fc7bce3087b52b9","observation_id":"d0391c6e-1b24-4948-9b00-a8c2744aa454","resolution":{"observed_at":"2026-08-16T05:40:10.306564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.285776Z","title":null,"venue":null,"work_id":"9f4cac17-18e0-45d7-8e7c-a597d442f4ea","year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.443899Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:2747a266a3847a9826701ade6d84dc422e585e1d53ddfbb43c0dd2951fb58f05","observation_id":"ede0c600-1e5e-4546-8b8e-15db8f5c538f","resolution":{"observed_at":"2026-08-16T05:40:10.290637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.269174Z","title":null,"venue":null,"work_id":"202ea4e4-c3fe-4c62-99d7-d8c01724d5ea","year":2006},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.448407Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:ec2c02fe824f722020fef5374b9dee93e9bbefca98071ce60bf0de2db885750b","observation_id":"78c37b0b-b751-4d8c-812b-8f2c0eb3be84","resolution":{"observed_at":"2026-08-16T05:40:10.274336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.453207Z","title":"von Werra, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.453207Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:34fa018f6913b63e56675d4f65028861064ed24e618ae58801587560534eeef1","observation_id":"88e587cd-4c3b-4ad9-93cb-8ef92bdc6926","resolution":{"observed_at":"2026-08-16T05:40:09.453207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.243411Z","title":null,"venue":null,"work_id":"1a46319c-9791-44c7-aed1-9b9306601ee7","year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.458205Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:bd55fecd0517fde0e192466bf1986ec640fb387345cfab1b09c59b4da5f7845c","observation_id":"ceb0dfb0-e5f0-41c0-b2a2-4499233940d3","resolution":{"observed_at":"2026-08-16T05:40:10.248070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.227172Z","title":null,"venue":null,"work_id":"62912071-35b9-425f-a09e-9a2949378d6f","year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.462785Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:cef8dd31e48c6fbbf4591e66e33e7cd6d26ee7670362b88fa8a7aa43d01fa486","observation_id":"81672bab-2540-4b7e-a93a-9d2bdb0a2356","resolution":{"observed_at":"2026-08-16T05:40:10.231946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-16T05:40:09.467576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.467576Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:546c61d6404e0f476a2fb8516f1a00af0678001f4c67478e21c8ffeff5d73d8b","observation_id":"8087916d-e8cb-4716-a863-e32a161a2792","resolution":{"observed_at":"2026-08-16T05:40:09.467576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.211112Z","title":null,"venue":null,"work_id":"f71eeede-5196-494f-b8b2-6b1ce439b424","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.472576Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:41fd9ce3dac20515d96c61689204cd5bd43f3a4231ff89692332b724f12832c0","observation_id":"9725a20f-ecbb-4e9d-b395-b5b8eff154be","resolution":{"observed_at":"2026-08-16T05:40:10.215955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-17T14:40:56.015819Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-16T05:40:09.477323Z","title":"Xiong, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.477323Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5fdf5d6990831b65deea143946ad696872d3419d5f0df0329f16577661b04592","observation_id":"d1fea079-aa42-499f-9b4d-ffc4df35466f","resolution":{"observed_at":"2026-08-16T05:40:09.477323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-16T14:31:20.852372Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-16T05:40:09.483189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.483189Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:863e32a185988a65ac359e17db66e1ac289efe04e1505165fba4cd72acb104d1","observation_id":"e727195b-d96b-45c0-b113-21d25c98ee16","resolution":{"observed_at":"2026-08-16T05:40:09.483189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T05:40:09.488443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.488443Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:066297d2f00ca78c8897be4988fa9a453b9c2028354a8cc519106f3da45c71d3","observation_id":"30273e3a-f987-4b7d-9c49-dd0e691a5f71","resolution":{"observed_at":"2026-08-16T05:40:09.488443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-16T05:40:09.493614Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.493614Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f02614a38785a1a8e50c07b3d4af9dfb7a304d197b27d3e4ba0bdf4e7b067cd4","observation_id":"3a049343-5f77-4b12-ba85-9963fe750d34","resolution":{"observed_at":"2026-08-16T05:40:09.493614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.499053Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.499053Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:c1962ed81347268d58a823deba2044c22f77fc981355a333535c76666aebcb2b","observation_id":"f871c059-471c-480a-a2df-30632b8255e1","resolution":{"observed_at":"2026-08-16T05:40:09.499053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16635","last_updated":"2024-10-22T06:19:20Z","snapshot_observed_at":"2026-08-16T14:23:26.502705Z","submitted_at":"2024-01-30T00:17:37Z","title":"Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16635","snapshot_observed_at":"2026-08-16T05:40:09.503684Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.503684Z"},"links":{"cited_paper":"/paper/2401.16635","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:9ccdaf6100afb1a547e9e97d01edce17fa9f182a95110f64103f5cc79c8ebaf1","observation_id":"16fbac64-21f1-4c7b-be01-69dcc5635eaa","resolution":{"observed_at":"2026-08-16T05:40:09.503684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-16T05:40:09.508737Z","title":"Zheng, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.508737Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:d642a5e83b3ca60151237ccf278de0aae863e8fcadddbbaf9378dd2cf67bd6f8","observation_id":"91dd55db-cff6-4a6f-b309-b58a9a88d1c6","resolution":{"observed_at":"2026-08-16T05:40:09.508737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T05:40:09.518689Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.518689Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:560a781bc720df7fd7b5077813e0f62745e4fb1381fa1e2b7eaccd60063c4682","observation_id":"28dd2998-59d5-438a-8394-5222b09e945c","resolution":{"observed_at":"2026-08-16T05:40:09.518689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.523386Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.523386Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f4e2d91a6d8c3a50438325bc272a5e1e0e8053f5a11b2dbd008c5c6092205f71","observation_id":"6aa3b570-ab53-40e2-bba8-cbe2d4dd9940","resolution":{"observed_at":"2026-08-16T05:40:09.523386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.528530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.528530Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:787ae12a7aea8e6018139a9e4e1a550ea6f67fc5f2d5cba4d2cebf0c050323d9","observation_id":"725ee1b4-4440-437b-a44b-19c7a9fe4673","resolution":{"observed_at":"2026-08-16T05:40:09.528530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18422","last_updated":"2025-03-20T19:18:24Z","snapshot_observed_at":"2026-08-17T15:08:31.317782Z","submitted_at":"2024-07-25T22:44:39Z","title":"A Black Swan Hypothesis: The Role of Human Irrationality in AI Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18422","snapshot_observed_at":"2026-08-16T05:40:09.533305Z","title":"Back to Basics: Revisiting REINFORCE -Style Optimization for Learning from Human Feedback in LLM s","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.533305Z"},"links":{"cited_paper":"/paper/2407.18422","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:86ebaaa95c6462ac7eab27dcac8e0ea694b639aa844b9f74ef22a72f598b681d","observation_id":"87e22da6-d4ce-4a22-b621-5a20094e4d05","resolution":{"observed_at":"2026-08-16T05:40:09.533305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T14:41:51.027766Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 3 inbound Pith citation observations for arXiv:2504.20157."}