{"as_of":"2026-08-20T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8234d6024c366daa5029c5bdd79b1a03f84a5d427ba79819e7aa6d2f897f73d1","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:11:38.289892Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09123/citation-record","integrity":"/paper/2608.09123/integrity","json":"/paper/2608.09123/citation-record.json","paper":"/paper/2608.09123"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-11T23:11:38.073068Z","title":"arXiv preprint arXiv:2507.17746 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.073068Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:903d7b3f25e4088861eda2168b669e479dd0577b47a12a60b799436fed58a051","observation_id":"4e9b37a6-534e-43c0-a234-3ec5e4e92e13","resolution":{"observed_at":"2026-08-11T23:11:38.073068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-11T23:11:38.080415Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.080415Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:39298d3bde387995adee67f111138541e2668b1167d9e6201dc99d333ceb2300","observation_id":"2889924e-d62e-4057-9eb2-c97356e32dfe","resolution":{"observed_at":"2026-08-11T23:11:38.080415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.085238Z","title":"arXiv preprint arXiv:2511.12344 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.085238Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:b6d3c22f2da2a5a1ea9639424d9b2f69aff42054d855e5b25fa75fcb5616104b","observation_id":"0a6f03e2-8876-42b4-b54c-3710f18f9f07","resolution":{"observed_at":"2026-08-11T23:11:38.085238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T23:11:38.089807Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.089807Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:9d7e99e53480bbbb1bac3d3d13d9394e91506b3b2399885f0e78c7355f2b7f98","observation_id":"e25f382d-7726-4dcd-8f98-3f52600eb963","resolution":{"observed_at":"2026-08-11T23:11:38.089807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.916816Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"7f946e71-2c18-42d5-aa28-b7c11976d35e","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.095300Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:1e83ad5fb120bfabab3569210dda800f6b755e94bbc8a95f1a0647f5b5133006","observation_id":"72b2f941-3755-4bb3-a9a8-6261975bf125","resolution":{"observed_at":"2026-08-11T23:11:38.921467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-11T23:11:38.100222Z","title":"arXiv preprint arXiv:2601.18734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.100222Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:5f54f841da7d6e8b91e48074f166b3c27e170817d7959f48043adebf525cd12f","observation_id":"08cc7842-2721-4c75-a21f-adc11d070f92","resolution":{"observed_at":"2026-08-11T23:11:38.100222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.105966Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.105966Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:58145a41855fd02ca627882b07afb3064b0c731eb939dcd9652a81e81d05b45e","observation_id":"0b4fe6c1-b781-4a5f-a769-ec0739941a65","resolution":{"observed_at":"2026-08-11T23:11:38.105966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-20T04:30:17.889769Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-11T23:11:38.110587Z","title":"arXiv preprint arXiv:2506.03106 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.110587Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a5b38592b319e9717e5a8a797c7134732ca136f8534b9747d446771bbe65df06","observation_id":"fe2f8e82-8e4d-4241-9d0c-09b7c8812357","resolution":{"observed_at":"2026-08-11T23:11:38.110587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12507","last_updated":"2026-06-10T17:53:19Z","snapshot_observed_at":"2026-08-12T17:05:26.243616Z","submitted_at":"2026-06-10T17:53:19Z","title":"Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers","version":1},"cited_work":{"arxiv_id":"2606.12507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.12507","snapshot_observed_at":"2026-08-11T23:11:38.562320Z","title":"Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers","venue":"cs.LG","work_id":"b0826660-be20-42f3-8e1f-3f5d913e087d","year":2026},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.115837Z"},"links":{"cited_paper":"/paper/2606.12507","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:11705ecabb54a7d19575b4f697dda454a472f7c2ce0831ff305d2c0692866757","observation_id":"6d5fcef0-a15f-44e5-8771-6266d75b7602","resolution":{"observed_at":"2026-08-11T23:11:38.568943Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-16T10:46:56.568912Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-11T23:11:38.121096Z","title":"arXiv preprint arXiv:2508.16949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.121096Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:ce1d1d1df7a30ef6b32c9195e77d3e0d8927bac4a93d3474f199ab0dfe6a6510","observation_id":"ae9b5fbc-19c2-4f56-a2a5-01ccf9ddf461","resolution":{"observed_at":"2026-08-11T23:11:38.121096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T23:11:38.126401Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.126401Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:9e3a2d93e5c901fa056010e74ba59e959bd666e6d8b92a33e5e8330f372175a5","observation_id":"0bed4ef3-626f-49c7-a965-fa73d374b097","resolution":{"observed_at":"2026-08-11T23:11:38.126401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T23:11:38.132503Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.132503Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:ed604b47d895723f97f9e2cf98132722cc05ec87403d13efcdb8f46e141a5fee","observation_id":"84dfdcd7-c8fb-47c0-b765-55322c1a2eed","resolution":{"observed_at":"2026-08-11T23:11:38.132503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.891148Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"df42e080-a53a-44ec-8e43-266362c01e53","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.137627Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a75898811e8f9396d62d1c3163d59a7cd3bb86ca7959134542de2c2125c387ad","observation_id":"28322207-e553-462d-91b6-485a2295f2c9","resolution":{"observed_at":"2026-08-11T23:11:38.897530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-11T23:11:38.142183Z","title":"arXiv preprint arXiv:2505.08775 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.142183Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:d94ad8a3f8ba929b0a7bfcf0cc4051b49d83a10767991e647cc9734a011ef0de","observation_id":"3bdef624-99cb-46d0-9025-8d16377d591f","resolution":{"observed_at":"2026-08-11T23:11:38.142183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04078","last_updated":"2025-08-31T14:41:06Z","snapshot_observed_at":"2026-08-14T23:26:08.616796Z","submitted_at":"2025-06-04T15:43:14Z","title":"LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04078","snapshot_observed_at":"2026-08-11T23:11:38.148136Z","title":"arXiv preprint arXiv:2506.04078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.148136Z"},"links":{"cited_paper":"/paper/2506.04078","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:d2e64290e37e845034e06d379eb9eb34148a344adf5a9300d6843116960b463d","observation_id":"64de9da0-61a2-4473-8bb0-e97d61f24011","resolution":{"observed_at":"2026-08-11T23:11:38.148136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.153305Z","title":"Applied Sciences , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.153305Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:bc75904d99a5c4710c24863598b573cc2b28508ea4dfbe179729a79c69c90df3","observation_id":"83fa3cc0-f6ed-4374-a9c0-f610deb970b2","resolution":{"observed_at":"2026-08-11T23:11:38.153305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-11T23:11:38.158924Z","title":"arXiv preprint arXiv:2406.11939 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.158924Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:ff9e462e97de40c394dde3949e17b17d25e63df1537f5a3e56f93dc13c4a1644","observation_id":"0b5f20ae-92ad-4554-980c-951c20179e7e","resolution":{"observed_at":"2026-08-11T23:11:38.158924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.864403Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"1af51798-460f-4d60-8f80-8ff291ca7fb3","year":2026},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.164677Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a6c6dd9ced80f05bd37bf3032e1a5469130b1cf5552bcfd9f036a77c9db8af4f","observation_id":"99bee403-91c7-4697-b25d-9935a7208b85","resolution":{"observed_at":"2026-08-11T23:11:38.871668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T23:11:38.170181Z","title":"arXiv preprint arXiv:2311.12022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.170181Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:156bcb5d603996a1add9600bb3c9f3cd2b4e2851d8521d27e3eb491f9f1b9a55","observation_id":"fc121aa3-0bed-4f75-af57-979f14a1cf01","resolution":{"observed_at":"2026-08-11T23:11:38.170181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.175090Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.175090Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:9edfaf2d93d386dadd4c124052f9025e527353fd6ec2c33639dad3db7fdf6470","observation_id":"5cef6ef6-5384-43ba-a09c-4d0c8b7a577e","resolution":{"observed_at":"2026-08-11T23:11:38.175090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.180318Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.180318Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:8e3c0bff87c202c2b8130cda24534764ecd3a84476cf9eb831c6a7eaa11f25a0","observation_id":"3de14e40-347c-4d9a-9978-5e867bbe0913","resolution":{"observed_at":"2026-08-11T23:11:38.180318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21801","last_updated":"2025-07-18T08:20:23Z","snapshot_observed_at":"2026-08-02T11:46:58.603316Z","submitted_at":"2025-04-30T16:57:48Z","title":"DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21801","snapshot_observed_at":"2026-08-11T23:11:38.186179Z","title":"arXiv preprint arXiv:2504.21801 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.186179Z"},"links":{"cited_paper":"/paper/2504.21801","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:20eebf55f12db0bbfe63348a5dc556eeffa815d09081e0d88ea304158f4c9fdb","observation_id":"04377bda-206d-4a30-8fd3-fabdb4c3d6b6","resolution":{"observed_at":"2026-08-11T23:11:38.186179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23726","last_updated":"2025-08-01T03:36:47Z","snapshot_observed_at":"2026-08-15T06:06:32.807242Z","submitted_at":"2025-07-31T17:00:30Z","title":"Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23726","snapshot_observed_at":"2026-08-11T23:11:38.192972Z","title":"arXiv preprint arXiv:2507.23726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.192972Z"},"links":{"cited_paper":"/paper/2507.23726","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:f4e01e37e70964e9250eac19592b47c3c3e2bba6bcb6a4cd9466805dc7bf2d21","observation_id":"e2b52015-9197-4f6a-948a-1c52fc66f927","resolution":{"observed_at":"2026-08-11T23:11:38.192972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00729","last_updated":"2026-02-28T16:25:04Z","snapshot_observed_at":"2026-08-14T11:50:51.747505Z","submitted_at":"2026-02-28T16:25:04Z","title":"Qwen3-Coder-Next Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00729","snapshot_observed_at":"2026-08-11T23:11:38.197504Z","title":"arXiv preprint arXiv:2603.00729 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.197504Z"},"links":{"cited_paper":"/paper/2603.00729","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:c694e0a19f937928a500c28df4e1c66e5301af299b3cee1097db349b5a679fcd","observation_id":"7258defc-00ed-4389-b722-b44d0ab08d68","resolution":{"observed_at":"2026-08-11T23:11:38.197504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.204640Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.204640Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:a70e60132ae4a0e65fb834386a9a6af81acde4b81962901a6f341cbf2b063ae3","observation_id":"aee86933-812c-4885-8a8b-4da80ce8a7f7","resolution":{"observed_at":"2026-08-11T23:11:38.204640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.824308Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":"e6b84f2a-2024-4217-a51a-2eff894ee17a","year":2023},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.210105Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:7ece651a1adf6abae88e6c55da597db41e45d1eec2423456fa115b7ed4be6037","observation_id":"83a8fd66-4828-47ab-8e32-3506cff0841e","resolution":{"observed_at":"2026-08-11T23:11:38.828544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00008","last_updated":"2025-02-13T12:10:33Z","snapshot_observed_at":"2026-08-19T12:43:06.304477Z","submitted_at":"2023-03-27T18:00:01Z","title":"On the Creativity of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00008","snapshot_observed_at":"2026-08-11T23:11:38.214884Z","title":"arXiv preprint arXiv:2304.00008 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.214884Z"},"links":{"cited_paper":"/paper/2304.00008","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:84fb218a2621ecb15189db73324a1e15be448e5526ae55fbbfe025b0195cee17","observation_id":"8e66481c-668f-48c6-b8d5-3e6499a81165","resolution":{"observed_at":"2026-08-11T23:11:38.214884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09838","last_updated":"2025-02-21T17:39:29Z","snapshot_observed_at":"2026-08-16T12:46:53.434136Z","submitted_at":"2025-02-14T00:42:36Z","title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09838","snapshot_observed_at":"2026-08-11T23:11:38.219627Z","title":"arXiv preprint arXiv:2502.09838 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.219627Z"},"links":{"cited_paper":"/paper/2502.09838","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:06aed9433565472392a0dc0ddeb3192b169983c5ffb7eae6deb44a591b98edb6","observation_id":"1c96373c-fbe9-4cd6-a317-02282b3da307","resolution":{"observed_at":"2026-08-11T23:11:38.219627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.810745Z","title":"Nature , volume=","venue":null,"work_id":"07cbcec2-6f89-4c0c-9a77-47c2e4ddd7e5","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.225075Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:216224978dcd8c94a0417856ff8d84b1f954cdb4a6e529c722eaaf5be5b42143","observation_id":"636e7c9e-4193-418b-8f5e-8bee23424b18","resolution":{"observed_at":"2026-08-11T23:11:38.815571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.229833Z","title":"Nature medicine , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.229833Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:10fe16261ac900c876d4e3f8c1df94132d8ee32b6d072e1f0ed414e69969832a","observation_id":"91db8d45-85b1-4afa-a212-92576f8c04a9","resolution":{"observed_at":"2026-08-11T23:11:38.229833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09939","last_updated":"2024-07-10T01:25:50Z","snapshot_observed_at":"2026-08-16T13:52:14.430502Z","submitted_at":"2024-05-16T09:42:37Z","title":"SciQAG: A Framework for Auto-Generated Science Question Answering Dataset with Fine-grained Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09939","snapshot_observed_at":"2026-08-11T23:11:38.236628Z","title":"arXiv preprint arXiv:2405.09939 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.236628Z"},"links":{"cited_paper":"/paper/2405.09939","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:bd1ed0902d83b04a3f569365fa3b0cbadae754fdec467c3e5943fe20388b027f","observation_id":"241a1351-f8bc-4b7d-aa6a-a1e5294f9b31","resolution":{"observed_at":"2026-08-11T23:11:38.236628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.783142Z","title":"Proceedings of the 34th ACM International Conference on Information and Knowledge Management , pages=","venue":null,"work_id":"22e43d5c-e837-4dbc-a284-fdb578d9370a","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.243254Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:3456968d9eabe7c6197949e27c87f372515ae9dd574e06d907bbcfbfe8e55a3f","observation_id":"58c720c6-929e-4461-896f-464740834da5","resolution":{"observed_at":"2026-08-11T23:11:38.787405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.767410Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics: system demonstrations , pages=","venue":null,"work_id":"dc2a077e-ad8f-472c-a2fc-5a4386808229","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.249500Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:fddd1620d1a9857d09726d38701ddf3e35b7c54980faebbc1af8bfdeaff4b89b","observation_id":"6adbf349-02cd-4418-84e7-31ccbcb8747b","resolution":{"observed_at":"2026-08-11T23:11:38.773222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.752522Z","title":"Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume , pages=","venue":null,"work_id":"8f061aaa-104e-42be-a01f-b939c99feb75","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.259339Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:ee42e6093ccc5a6db6a893f55144f53f6ca0e0852f402bc0cba3b5a50cc5375c","observation_id":"c57b886f-9d57-441b-9441-3167ad8120cf","resolution":{"observed_at":"2026-08-11T23:11:38.758328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-11T23:11:38.266959Z","title":"arXiv preprint arXiv:2201.08239 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.266959Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:3dc3c1e7ce28937d413871c0fac57f1c04715926e76e2ab0ef7149ea8cfdf0d7","observation_id":"cb1e5e7e-dcdf-4ff3-86db-55733153b85e","resolution":{"observed_at":"2026-08-11T23:11:38.266959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.738416Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5965a899-fd1f-480e-92ac-dc72898f94a0","year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.273675Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:eafd724fa26fd48d0846af3193d9bd1ad2fbabfe8f8a073dbbb543670f3fbc1b","observation_id":"fdf34d31-bf96-4e2e-a42f-05c2132e88ae","resolution":{"observed_at":"2026-08-11T23:11:38.742637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-11T23:11:38.279670Z","title":"arXiv preprint arXiv:2601.20802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.279670Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:d811752cfc909a09f3f55ee7f93aedb94e162eb0697f4a9397c23d173e4a00dd","observation_id":"ff5e8cbd-2f24-4256-ab36-2b320446ab19","resolution":{"observed_at":"2026-08-11T23:11:38.279670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-08-13T01:43:27.853141Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-11T23:11:38.284922Z","title":"arXiv preprint arXiv:2605.28014 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.284922Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:33d9d348d331ef4e58ff206e1a60e0f157fb37d120fa2e75d954c88369b197c3","observation_id":"7e05d968-6086-4871-b0ca-baa86e11f4bd","resolution":{"observed_at":"2026-08-11T23:11:38.284922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:11:38.725651Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"2df1bba7-87c2-4766-b07e-702b9e4a94c7","year":2026},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.289892Z"},"links":{"citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:b92ca7aa26d7a0cecbcc12b1f930dd76f23aa6df1967fd29514c61764d99531e","observation_id":"37745c5f-89e8-4a9d-a9f0-a24d32e33a31","resolution":{"observed_at":"2026-08-11T23:11:38.729881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T07:10:56.288467Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.09123."}