{"as_of":"2026-08-16T13:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79b10313290571bef7ac24de2a904580f8b50f33f1ef6a0baa78e47eaaf2f8bb","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:48:47.919007Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.15068/citation-record","integrity":"/paper/2506.15068/integrity","json":"/paper/2506.15068/citation-record.json","paper":"/paper/2506.15068"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-14T23:03:16.281379Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-08-15T19:48:46.792003Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.792003Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:8a7bc362b1f6c45c00b07841d79d354b62b7eefda4aed72a003e1c94e0c4834a","observation_id":"59633c9a-84b7-4b34-bf4d-4b5148322299","resolution":{"observed_at":"2026-08-15T19:48:46.792003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T19:48:46.824662Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.824662Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:c8f82df3ad040646b5817634da9a1184146c9c2208f293b016a7e7f99393a1e7","observation_id":"42880985-535d-434f-8c33-503a6db4456e","resolution":{"observed_at":"2026-08-15T19:48:46.824662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:46.829718Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.829718Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:57a35ce5467ca30a60a303dd30b2167167611bd44a7b605312d2f0b56c64d06c","observation_id":"82c7b8bb-6cd8-4b10-9960-85dbb0006565","resolution":{"observed_at":"2026-08-15T19:48:46.829718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:46.833859Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.833859Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:afc83ff47bfbed8367990559ade8d8f71a2ca6ac319e7f212d73611a298f8e8e","observation_id":"9b0f817d-33ce-49ea-a5df-f73e5b90ac41","resolution":{"observed_at":"2026-08-15T19:48:46.833859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:46.838048Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.838048Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:2d8887178ecb84ec76cf5593e6a9c3936d7505a4358a1c890830e75828b987c7","observation_id":"7cfdd1aa-03dc-4f08-9ddd-6574288410bf","resolution":{"observed_at":"2026-08-15T19:48:46.838048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.528","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.950735Z","title":null,"venue":null,"work_id":"8a737939-7974-47dc-b7ee-0b606eae4ba1","year":2020},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.842925Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:8182409be1be147355a2ee5966ebaaa07907b4364ceba395d94af3e551b40150","observation_id":"7b1ddaaf-0d5a-433e-a3ee-d08404b52603","resolution":{"observed_at":"2026-08-15T19:48:47.956081Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T19:48:46.903746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.903746Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:c5868cd060b851617b81be95c65d6ccf6410a8a531fc4d76ca453128549495b7","observation_id":"c5652fe0-37c2-4443-9162-5b0b1bb0ad3d","resolution":{"observed_at":"2026-08-15T19:48:46.903746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05657","last_updated":"2023-10-09T12:12:55Z","snapshot_observed_at":"2026-08-13T07:32:59.599278Z","submitted_at":"2023-10-09T12:12:55Z","title":"A Closer Look into Automatic Evaluation Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05657","snapshot_observed_at":"2026-08-15T19:48:46.963076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.963076Z"},"links":{"cited_paper":"/paper/2310.05657","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:9b5aee5bac0c508a2f9200091c33f56a82d42988a98887b6943ddc8db0da1b81","observation_id":"ab4f6210-4423-471c-a539-eaf97fb7ffdd","resolution":{"observed_at":"2026-08-15T19:48:46.963076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:46.967870Z","title":"Angelopoulos, Tianle Li, Dacheng Li, Banghua Zhu, Hao Zhang, Michael I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.967870Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:2e636b807d240870c4a9d8bc663ed12c4d64fbff5a73343253e94272fcd15587","observation_id":"b38cd49c-ff9f-41cb-9bb8-dd8aa9d367b9","resolution":{"observed_at":"2026-08-15T19:48:46.967870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:48:46.972385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.972385Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:20ea08138eb54cdac7cc6348b7c413ca4a099593c2ef0c598998d4aeb4778935","observation_id":"70d93744-92bd-46a9-a678-06b9312ab7dd","resolution":{"observed_at":"2026-08-15T19:48:46.972385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-11T11:33:47.725577Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-15T19:48:46.976457Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.976457Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:c13023f863742c18cc3b93249d5449ffb73ecd117a31aea78c6384f1e1aee93a","observation_id":"9fa16c0b-d5f1-4873-8484-7c74e090c983","resolution":{"observed_at":"2026-08-15T19:48:46.976457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-15T19:48:46.981211Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.981211Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:64b24fb1600e2055c191748f447a2611c740b842d66c566986b1d046a1900be6","observation_id":"7a0908a3-b4e9-4944-8c41-2c9f90b74268","resolution":{"observed_at":"2026-08-15T19:48:46.981211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.12626","last_updated":"2021-02-01T19:56:15Z","snapshot_observed_at":"2026-08-15T13:29:27.838726Z","submitted_at":"2020-07-24T16:25:19Z","title":"SummEval: Re-evaluating Summarization Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.12626","snapshot_observed_at":"2026-08-15T19:48:46.985186Z","title":"Fabbri, Wojciech Kryściński, Bryan McCann, Caiming Xiong, Richard Socher, and Dragomir Radev","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.985186Z"},"links":{"cited_paper":"/paper/2007.12626","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:99ad9bd46cee0b0e2c77f165880145c843a423fb235da4588a43b69014359a82","observation_id":"c711cc16-073e-493f-a9dc-5fd00a35fd2f","resolution":{"observed_at":"2026-08-15T19:48:46.985186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09190","last_updated":"2019-07-22T09:01:35Z","snapshot_observed_at":"2026-08-15T01:16:28.394234Z","submitted_at":"2019-07-22T09:01:35Z","title":"ELI5: Long Form Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09190","snapshot_observed_at":"2026-08-15T19:48:46.993204Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.993204Z"},"links":{"cited_paper":"/paper/1907.09190","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:9a2e6f8d5106fd6efd9f81914d089b4eab9a2c5bb91b0ff8bc49ce708d99d4e3","observation_id":"f9f89c67-2d0e-487b-8ab7-d9944da35723","resolution":{"observed_at":"2026-08-15T19:48:46.993204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T19:48:47.109728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.109728Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:501144b4a3e4081ce573514a07d4daaafee3306903d074a748fdbd76fc4745ea","observation_id":"f87806cf-b748-4071-8717-7ddfc286289e","resolution":{"observed_at":"2026-08-15T19:48:47.109728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-15T19:48:47.152322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.152322Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:a35936511ae1de73c114421010985007e56dc92e7c53d59b6144f28f4239eceb","observation_id":"4a4a841e-ca3a-4ddc-aa54-1cafb9661be7","resolution":{"observed_at":"2026-08-15T19:48:47.152322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-13T05:47:51.554813Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-15T19:48:47.156442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.156442Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:b63b3ab54c5df4278ce464f28f611cacbcab9fe4b16cb8bcd9e4f6bfc353b9f0","observation_id":"efa151a7-b8e1-4f0f-80bf-09e365e4def7","resolution":{"observed_at":"2026-08-15T19:48:47.156442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06332","last_updated":"2021-05-19T12:01:54Z","snapshot_observed_at":"2026-08-14T09:18:48.387632Z","submitted_at":"2021-03-10T20:32:30Z","title":"Hurdles to Progress in Long-form Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06332","snapshot_observed_at":"2026-08-15T19:48:47.160503Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.160503Z"},"links":{"cited_paper":"/paper/2103.06332","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:22abd49f2a1db357206008dd789f7dff2aed1c3b0d87ec648347518ef4d9a18f","observation_id":"4c742731-11ea-453a-b364-66c2639d2694","resolution":{"observed_at":"2026-08-15T19:48:47.160503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05061","last_updated":"2026-08-11T15:28:16Z","snapshot_observed_at":"2026-08-14T23:11:22.741737Z","submitted_at":"2025-03-07T00:42:08Z","title":"No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05061","snapshot_observed_at":"2026-08-15T19:48:47.164830Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.164830Z"},"links":{"cited_paper":"/paper/2503.05061","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:dfc8e56c2b4198ba48ba0f288856ae905c75254a03bf1ed8a4284809255ca350","observation_id":"07198add-f6ef-4dbe-a58c-f159f398f067","resolution":{"observed_at":"2026-08-15T19:48:47.164830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.169094Z","title":"Kullback and R","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.169094Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:c8470ee635c7ccef4f4fdd9dd4f4143053dde6deace012637dd250b0fdbda46e","observation_id":"d7fa89f0-82dc-4452-b104-3b6221a3f719","resolution":{"observed_at":"2026-08-15T19:48:47.169094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08460","last_updated":"2024-10-03T15:46:13Z","snapshot_observed_at":"2026-08-14T22:18:19.372081Z","submitted_at":"2023-04-17T17:36:35Z","title":"LongForm: Effective Instruction Tuning with Reverse Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08460","snapshot_observed_at":"2026-08-15T19:48:47.173159Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.173159Z"},"links":{"cited_paper":"/paper/2304.08460","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:e6edd6e967b0971ca332c1c3f225fa0bf9bb5c7e2a6c65f1b25a51ed71ec65cf","observation_id":"b19010c5-7788-4fde-bea5-fb3b124d0b0f","resolution":{"observed_at":"2026-08-15T19:48:47.173159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-15T03:01:41.971978Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-15T19:48:47.177700Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.177700Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:cfecf06bfc2bb2c8f17857c6898173abd57e84a237f053d4339ca274032ebc43","observation_id":"b1ada493-ff02-4dd9-a496-6bf5f803497c","resolution":{"observed_at":"2026-08-15T19:48:47.177700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-14T07:43:43.015539Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-15T19:48:47.196869Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.196869Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:e5c17dc601e7eb553baa26c101cf75d0d91df91e3dd19f4c16a324a5e5a9a760","observation_id":"911a17c8-de7d-42c1-a6ef-a86504782f47","resolution":{"observed_at":"2026-08-15T19:48:47.196869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01541","last_updated":"2016-09-29T15:02:32Z","snapshot_observed_at":"2026-08-14T21:54:08.133617Z","submitted_at":"2016-06-05T17:59:23Z","title":"Deep Reinforcement Learning for Dialogue Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01541","snapshot_observed_at":"2026-08-15T19:48:47.266034Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.266034Z"},"links":{"cited_paper":"/paper/1606.01541","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:3f54d5d951af6cdf8d2882359f28e31a0b58ba031d0217e1cc236515d29a6ba5","observation_id":"bb7991a5-270e-4e7d-b946-c45ccf307c73","resolution":{"observed_at":"2026-08-15T19:48:47.266034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11161","last_updated":"2024-10-11T20:56:36Z","snapshot_observed_at":"2026-08-13T04:17:10.537369Z","submitted_at":"2024-02-17T01:56:19Z","title":"PEDANTS: Cheap but Effective and Interpretable Answer Equivalence","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11161","snapshot_observed_at":"2026-08-15T19:48:47.341857Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.341857Z"},"links":{"cited_paper":"/paper/2402.11161","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:0b578d4ec1fb35d183dd7784816878a368d8d0b6665aa3f9bee155b3316b088a","observation_id":"ffc1a410-d56b-412f-9094-dce7e371e508","resolution":{"observed_at":"2026-08-15T19:48:47.341857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:49.068538Z","title":null,"venue":null,"work_id":"8bd2e515-50c9-4009-905b-6fe231e7499e","year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.346440Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:135bb864028aee95c682ab99f17190c733a1142ea0a316361ba83ddfae05a416","observation_id":"49f107d5-ae54-4120-9047-51de611f1b45","resolution":{"observed_at":"2026-08-15T19:48:49.072381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.349856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.349856Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:2b9be08305ea83e91c91e31d3cc84c0653fa4b403d415678a1a7e8413834b780","observation_id":"df51d059-bcb6-4a3b-bbcb-72dac589f17c","resolution":{"observed_at":"2026-08-15T19:48:47.349856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:49.056767Z","title":null,"venue":null,"work_id":"eaa5deec-0ce8-4556-b24d-4625d588befd","year":2004},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.354409Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:351ce8a29d352c215ac55b6cab1ae450d5f7537411cb5e48fc276eb921c1723e","observation_id":"8c56b692-c4c2-4d25-8589-c10ec768514b","resolution":{"observed_at":"2026-08-15T19:48:49.060450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-15T19:48:47.358973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.358973Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:00ba7410d84fd3cbc3ef0755a8d51dcf6dcddb576c4a45913c391742d63db612","observation_id":"6e17e919-6fd1-41e5-8794-8c9214c39b57","resolution":{"observed_at":"2026-08-15T19:48:47.358973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T19:48:47.363358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.363358Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:b79ef8fdeba3f8bb30e30623a5520bd57c6eab86639abd2e8fa33a34aec8a552","observation_id":"4291197c-ead8-4f98-9239-b0b637b29654","resolution":{"observed_at":"2026-08-15T19:48:47.363358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.368219Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.368219Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:a32e26cf84426f27a42466852160659960b9a9151da2521b03cba40517ba3c55","observation_id":"8833ad02-2bce-4a3f-86a6-d04de55c472b","resolution":{"observed_at":"2026-08-15T19:48:47.368219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.426148Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.426148Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:0f49a4a874896025acc264cd0cc67eccb0f4b9f7f9c3224c64191678439311c8","observation_id":"7b1cb00b-6330-4a72-8ca3-e3c80af6e88a","resolution":{"observed_at":"2026-08-15T19:48:47.426148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T19:48:47.445193Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.445193Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:05796533cdf6ddfc02706a5ef9a59d74737cfab5b693e8d97d05144cb08c4b20","observation_id":"caf6aad0-cb9e-486c-90a8-55ce572490db","resolution":{"observed_at":"2026-08-15T19:48:47.445193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00186","last_updated":"2023-05-31T21:04:04Z","snapshot_observed_at":"2026-08-13T11:27:53.681785Z","submitted_at":"2023-05-31T21:04:04Z","title":"Factually Consistent Summarization via Reinforcement Learning with Textual Entailment Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00186","snapshot_observed_at":"2026-08-15T19:48:47.490328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.490328Z"},"links":{"cited_paper":"/paper/2306.00186","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:b77315d78c028a26301e32696edb6a5822aa0663f3f6a7f2d0294331a6c9bb21","observation_id":"e0d3f46b-16be-4087-a909-0c6928e5e594","resolution":{"observed_at":"2026-08-15T19:48:47.490328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12114","last_updated":"2024-06-17T21:45:48Z","snapshot_observed_at":"2026-08-16T13:42:02.721192Z","submitted_at":"2024-06-17T21:45:48Z","title":"Enhancing Text Classification through LLM-Driven Active Learning and Human Annotation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12114","snapshot_observed_at":"2026-08-15T19:48:47.494498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.494498Z"},"links":{"cited_paper":"/paper/2406.12114","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:2e84feb8c6d1820c2c463a33cbd48c26531722b116ccdc0260feb3a47db0efff","observation_id":"2172f24f-836d-4973-bc8c-088284703ebc","resolution":{"observed_at":"2026-08-15T19:48:47.494498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T19:48:47.498566Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.498566Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:a7bb6b0b07dfde0b6bfd12624b854abc1dd3a1b5747f07a5d240611df8296964","observation_id":"0ed25aac-2353-47cb-8753-c3843f9b9a99","resolution":{"observed_at":"2026-08-15T19:48:47.498566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10944","last_updated":"2019-12-26T14:47:34Z","snapshot_observed_at":"2026-07-06T08:46:35.151523Z","submitted_at":"2019-12-23T16:04:40Z","title":"A Survey of Deep Reinforcement Learning in Video Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.10944","snapshot_observed_at":"2026-08-15T19:48:47.502875Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.502875Z"},"links":{"cited_paper":"/paper/1912.10944","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:536a6c29a1d4dabf7fbc9425b0715f05c458391375e3986b889c9df830314167","observation_id":"d8c6387f-e736-4847-8856-3b8f8f9b70ef","resolution":{"observed_at":"2026-08-15T19:48:47.502875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:49.038738Z","title":null,"venue":null,"work_id":"a4dea61e-a2a1-4eaa-baec-cebf0972684b","year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.508657Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:c91fc89bc22e14421349f27e0a751b02d53affe552383877e4f74e0f2cfc40bc","observation_id":"21355d6d-53d0-42d9-89ce-3933300a6fc7","resolution":{"observed_at":"2026-08-15T19:48:49.043155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-15T19:48:47.511830Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.511830Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:a49f566137e75a5ca4f37dbd77904536b94d0c337a50746cf647e2120be550f7","observation_id":"3343d9bf-eafe-4e63-80b1-18cb54921874","resolution":{"observed_at":"2026-08-15T19:48:47.511830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:49.013392Z","title":"Hashimoto","venue":null,"work_id":"7e0fe826-4aa7-481e-a25c-a97c451761e7","year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.515624Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:aa3e341eb5706f1aaceaf8463024a793e554e71dab17238c5260d09371a77cd6","observation_id":"398115cb-a38d-4ff8-9663-c0d3013a26f7","resolution":{"observed_at":"2026-08-15T19:48:49.030890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.518693Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.518693Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:75d78453cbd4a5f6ab8acff6fa736038c34234fe416b7053e5814b76d1a9e0dd","observation_id":"72d469f1-4e11-40b5-8359-e58a2bcfc064","resolution":{"observed_at":"2026-08-15T19:48:47.518693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.522256Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.522256Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:34fac22ee0ef01296c8914d2c039a14fe64bb938074631c8494cd64239762f21","observation_id":"412274bc-b360-4114-9db9-a1b5c0282261","resolution":{"observed_at":"2026-08-15T19:48:47.522256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-08-14T20:02:35.071920Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-15T19:48:47.589286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.589286Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:1974ef636a8be58d487178fc9bc7506b107688a68636056fca5012dd02147074","observation_id":"11899969-0add-487d-bb90-380a48fbdb83","resolution":{"observed_at":"2026-08-15T19:48:47.589286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:48.914849Z","title":null,"venue":null,"work_id":"89b27458-f19f-4b80-9af8-2798a9d7ad6b","year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.646879Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:f67da9b5645f0176083e282adcb45d87ac201d681f839d1bb1215d4de951e832","observation_id":"92417eca-0019-483a-90f9-b093826c8ad8","resolution":{"observed_at":"2026-08-15T19:48:48.945108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-08-15T12:38:36.159182Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-08-15T19:48:47.650992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.650992Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:2e96da18c19cd5dacbbd7e7c574c42eeb3821fcef74a5789512e9a585853679d","observation_id":"290d8a8f-01fb-4548-89df-a767ace4b939","resolution":{"observed_at":"2026-08-15T19:48:47.650992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-16T13:42:51.381554Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-15T19:48:47.655647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.655647Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:323afef6fa00ff35a800f3d8fe25605cc40ad6efb9764466435918eb75f913b1","observation_id":"a98bc16a-ab2f-4290-95e6-7b81c94ec08d","resolution":{"observed_at":"2026-08-15T19:48:47.655647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T19:48:47.659845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.659845Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:29cebbbbb396ad1fc09217494b45a5d7dde974421e963bb64b64883c1c17fcb9","observation_id":"c51569b5-6d49-412f-baa6-70af2a9c25f0","resolution":{"observed_at":"2026-08-15T19:48:47.659845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.664012Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.664012Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:a85eac56240c8b7e3e1ad5a89227d0522963c9f278a93b863c4484e44ae4674f","observation_id":"5608c357-1103-4bb8-950f-b36f355de604","resolution":{"observed_at":"2026-08-15T19:48:47.664012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T19:48:47.667853Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.667853Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:259d8867f2b685bf39fd11b996e9129db3ac8b4fc4d50c80264133068e57f26a","observation_id":"9e215979-2aa4-4017-9edc-3cc08fc24453","resolution":{"observed_at":"2026-08-15T19:48:47.667853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T19:48:47.671746Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.671746Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:fda16b4704c62dff286d4cdd45e46170a1d10d9f7413d2515b37139e1b3dadad","observation_id":"9ea4d148-32eb-46c8-83ca-a04a4bf37f9e","resolution":{"observed_at":"2026-08-15T19:48:47.671746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-08-08T19:18:06.171048Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-15T19:48:47.676062Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.676062Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:18116e1ea497fe97d9b9aea400c8fc26402f3ac32a4eff132a71a4bc6a38218f","observation_id":"35925866-a29d-4310-a845-2157a35a91f0","resolution":{"observed_at":"2026-08-15T19:48:47.676062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05322","last_updated":"2024-06-08T02:17:43Z","snapshot_observed_at":"2026-08-16T13:44:59.188835Z","submitted_at":"2024-06-08T02:17:43Z","title":"Teaching-Assistant-in-the-Loop: Improving Knowledge Distillation from Imperfect Teacher Models in Low-Budget Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05322","snapshot_observed_at":"2026-08-15T19:48:47.680838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.680838Z"},"links":{"cited_paper":"/paper/2406.05322","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:8b59b93e75e295eb6467efcec42182cb1a83da7dbd8dac3bb41e32055e0befb6","observation_id":"9d2223ba-ca32-4984-a71d-2faf3e8d0469","resolution":{"observed_at":"2026-08-15T19:48:47.680838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00997","last_updated":"2025-02-17T16:51:23Z","snapshot_observed_at":"2026-08-13T18:29:32.612859Z","submitted_at":"2025-02-03T02:34:46Z","title":"MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs","version":3},"cited_work":{"arxiv_id":"2502.00997","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00997","snapshot_observed_at":"2026-08-15T19:48:48.073880Z","title":"MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs","venue":"cs.CL","work_id":"b79a9415-1d3f-4df8-84e5-d89e9095f6c0","year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.684812Z"},"links":{"cited_paper":"/paper/2502.00997","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:3a0b8f2d4f4a190d56ab985ca0781b2dcad494257a59d26a940be5ea56e6d2b4","observation_id":"51ad07ec-509b-42f6-98b4-1090207865f2","resolution":{"observed_at":"2026-08-15T19:48:48.164263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.776043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.776043Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:ccf06b1b439e5bf896ea7e350aadf483a86f1b216ded7f08cb7ecc20a70ec93b","observation_id":"98ba6f26-631e-4f9b-8f52-c5861c9c830e","resolution":{"observed_at":"2026-08-15T19:48:47.776043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.869226Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.869226Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:6c0d3f3e96d7cedf4cc8e3d693e7aec9eff0cef5194eefc06b2ea61c7e8f15dc","observation_id":"a61909ed-061a-4b0e-a02b-c77979fd6e2f","resolution":{"observed_at":"2026-08-15T19:48:47.869226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:48:47.919007Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:47.919007Z"},"links":{"citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:9201720c08014450ca2bb72a2044710ca038c9c112dbaab3efd082b37a3420c1","observation_id":"729d134a-ba3a-4338-a043-824819ecca29","resolution":{"observed_at":"2026-08-15T19:48:47.919007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2506.15068."}