{"as_of":"2026-08-10T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:432912bcee97ad3f908f3f1b253feb06076b2d2a49ef1f75183ccbe830f7919e","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:43:58.144921Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.12576/citation-record","integrity":"/paper/2512.12576/integrity","json":"/paper/2512.12576/citation-record.json","paper":"/paper/2512.12576"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-03T16:43:54.836145Z","title":"DeepSeek-AI, Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., Zhang, X., Yu, X., Wu, Y ., Wu, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.836145Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:34c4fa7d55834da080262da6bdf78171e236a0c76304f3fe0bb29ddb9cdfd60b","observation_id":"3497387c-12ee-49bb-801a-3631be7a3bb7","resolution":{"observed_at":"2026-08-03T16:43:54.836145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T16:43:54.952300Z","title":"Ho, J., Jain, A., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.952300Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:29638a01dd16de3b75843b3685a7616c84c897cb682a85de645465565e94de98","observation_id":"1a5dfe83-8427-40a7-b41e-8dadf5934bd3","resolution":{"observed_at":"2026-08-03T16:43:54.952300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-03T16:43:55.183222Z","title":"Kwon, W., Li, Z., Zhuang, S., Sheng, Y ., Zheng, L., Yu, 9 Coupled Variational Reinforcement Learning for Language Model General Reasoning C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:55.183222Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:37fb6de0b96379a3d070b753626586ece8786412cb90b4caf8c35b3fdd2cea27","observation_id":"40e1fcc6-1eaf-44c7-925f-cc05714f5343","resolution":{"observed_at":"2026-08-03T16:43:55.183222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-03T16:43:55.364185Z","title":"Li, R., Li, X., Lin, C., Collinson, M., and Mao, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:55.364185Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:0d708efe4e08f02f277f361175cfdb9729a942732a43968e39bd9fb2f704b301","observation_id":"6c5b8c08-1601-4292-88d2-341ce52d9524","resolution":{"observed_at":"2026-08-03T16:43:55.364185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:43:55.743062Z","title":"Ling, W., Yogatama, D., Dyer, C., and Blunsom, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:55.743062Z"},"links":{"citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:1dae3b4bcf09ab1e777d174186328e189ac8077f92a47d11adf694d6b7c72149","observation_id":"2290000d-250f-4ada-bb46-e38ec905da98","resolution":{"observed_at":"2026-08-03T16:43:55.743062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-08T07:13:10.579807Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14652","snapshot_observed_at":"2026-08-03T16:43:56.063243Z","title":"Mathematical Association of America","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.063243Z"},"links":{"cited_paper":"/paper/2505.14652","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:a41137fbaaf03ef976394f04f11874308a6dd58f851affeccf0ee648c6436dce","observation_id":"f3cbd91c-f7c8-41f4-983f-73cbf847eeea","resolution":{"observed_at":"2026-08-03T16:43:56.063243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:43:56.213416Z","title":"Con- tains 32 math questions from May 2023 SAT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.213416Z"},"links":{"citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:de01655dc08088345261ba6a0328144e47eeb0241b8d6c899d84146ee06787f6","observation_id":"37f9f366-a0f3-4470-bc4d-9f6148da8e13","resolution":{"observed_at":"2026-08-03T16:43:56.213416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-03T16:43:56.345427Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.345427Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:287c575d32080b52e0451a8f68c822e62c1fe1d37673ea5e56c807fcdfb2e937","observation_id":"ca7b58c3-e35f-410a-ae60-dae9cfdb3602","resolution":{"observed_at":"2026-08-03T16:43:56.345427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T16:43:56.535548Z","title":"Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.535548Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:bfcd895d229dfd79e23a91fddebaa0b5f72c449a19f0352a4cf57641b0a73f8f","observation_id":"70c9bf1e-8376-4080-876d-81ff21b63c2a","resolution":{"observed_at":"2026-08-03T16:43:56.535548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-03T16:43:56.609302Z","title":"Rein, D., Hou, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.609302Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:529359eaa6e9959bda85dfcfb067553e7c16662bb7bbf01dcc5ca2096b53f359","observation_id":"03e68c57-8a5d-4486-ac96-719212089c52","resolution":{"observed_at":"2026-08-03T16:43:56.609302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-03T16:43:56.708534Z","title":"Schulman, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.708534Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:a4ad3d1f8fe92dfb546bb35dbf8d0d2d55af79d30635a6a9cda6ae35648fea65","observation_id":"cbc0d829-1989-4f9e-a83d-b0726aab6594","resolution":{"observed_at":"2026-08-03T16:43:56.708534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T16:43:56.772053Z","title":"Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., Zhang, H., Zhang, M., Li, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.772053Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:ddf3078fa57d39dc4b4a8ef8a6f2888b784b8aece14b09479b3062a623967eab","observation_id":"e54c9422-7261-488f-8b32-076fb86ce597","resolution":{"observed_at":"2026-08-03T16:43:56.772053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T16:43:56.842532Z","title":"Sheng, G., Zhang, C., Ye, Z., Wu, X., Zhang, W., Zhang, R., Peng, Y ., Lin, H., and Wu, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.842532Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:0f2c8aaf96ec0ed8cc4b98946b726f4b539f66134548e3b31f8fc500ebc724ab","observation_id":"9d8ee088-8d68-4994-a5ee-8f3e5d9904f4","resolution":{"observed_at":"2026-08-03T16:43:56.842532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-03T16:43:56.945344Z","title":"Tang, Y ., Wang, S., Madaan, L., and Munos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.945344Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:c6a46e0e9747aa57e429524426f16778fc371a49e3848ce2979da81b53bdd55a","observation_id":"571222e9-820a-477a-ac3c-11adea58878b","resolution":{"observed_at":"2026-08-03T16:43:56.945344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19618","last_updated":"2025-05-28T14:42:09Z","snapshot_observed_at":"2026-08-07T16:38:29.183974Z","submitted_at":"2025-03-25T13:03:09Z","title":"Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19618","snapshot_observed_at":"2026-08-03T16:43:57.074776Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.074776Z"},"links":{"cited_paper":"/paper/2503.19618","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:a6166fb208bd0a0c5ba210fc83b17a245010c8e6156343117ed08c118e95addf","observation_id":"9793575a-5edd-46e4-a648-7609fd8e5b4f","resolution":{"observed_at":"2026-08-03T16:43:57.074776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:43:57.273034Z","title":"Accessed: 2025-01-23","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.273034Z"},"links":{"citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:f97b8b43ab78ec9b60cb947756f58a0f8c8aa0a899aec2046c8460ed60c30a49","observation_id":"4097a892-2d58-475f-8c93-65fb44437048","resolution":{"observed_at":"2026-08-03T16:43:57.273034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-03T16:43:57.348223Z","title":"Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q., and Zhou, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.348223Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:89a4e68d564986c1e78c051ca0bd6233d9a9cee68f8bdebbceaf1fd4e97e7750","observation_id":"1bb6e91e-f99c-434f-94c0-21869bc5e718","resolution":{"observed_at":"2026-08-03T16:43:57.348223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-03T16:43:57.528598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.528598Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:bc63bcf9f710762be40771e69d194140d42956f766a4a04157d06c83cb42b12b","observation_id":"905da558-301d-4278-97b4-c12f208f8ab1","resolution":{"observed_at":"2026-08-03T16:43:57.528598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T16:43:57.687482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.687482Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:f1813f5643161652a9ab3492821416162cd9cb000891f0a0f55328696845a6a5","observation_id":"02882fce-fdb2-4124-8bec-9b46003db01d","resolution":{"observed_at":"2026-08-03T16:43:57.687482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-03T16:43:57.799392Z","title":"Yue, X., Zheng, T., Zhang, G., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.799392Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:21be65be742a145ea18d2df0454c008f5a062b2b8af3ac485aa527d3a6c0cfb9","observation_id":"6b66f49f-04bf-4706-aedb-d3cab0e19629","resolution":{"observed_at":"2026-08-03T16:43:57.799392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03548","last_updated":"2024-05-23T16:34:35Z","snapshot_observed_at":"2026-08-10T09:54:53.085558Z","submitted_at":"2024-05-06T15:11:38Z","title":"MAmmoTH2: Scaling Instructions from the Web","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03548","snapshot_observed_at":"2026-08-03T16:43:57.892407Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.892407Z"},"links":{"cited_paper":"/paper/2405.03548","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:76205643228fb326da3a147f41754a3ae35cb568e9d415da78938052eb0eadd9","observation_id":"aae23b8d-5928-4e2a-9202-60cc7bc8c165","resolution":{"observed_at":"2026-08-03T16:43:57.892407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T16:43:57.954210Z","title":"Zhang, B., Zhou, K., Wei, X., Zhao, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.954210Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:c2bbacb572d57f7b5e99a76bfc3b21b4ed0445809fe47d76882dca46b7222ddb","observation_id":"42998865-32a2-4ce8-880b-7e501606d255","resolution":{"observed_at":"2026-08-03T16:43:57.954210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02408","last_updated":"2023-06-04T17:02:59Z","snapshot_observed_at":"2026-08-09T04:03:16.503506Z","submitted_at":"2023-06-04T17:02:59Z","title":"Evaluating and Improving Tool-Augmented Computation-Intensive Math Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02408","snapshot_observed_at":"2026-08-03T16:43:58.027815Z","title":"Zhao, Y ., Liu, Y ., Liu, J., Chen, J., Wu, X., Hao, Y ., Lv, T., Huang, S., Cui, L., Ye, Q., Wan, F., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:58.027815Z"},"links":{"cited_paper":"/paper/2306.02408","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:fa10f8dd8e0b3e03d4066c1119e10e1f76775f6d905d171f6036b10479df1074","observation_id":"4ad521f6-daf6-494d-ba12-97f25ef4b993","resolution":{"observed_at":"2026-08-03T16:43:58.027815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:43:58.082657Z","title":"Zhou, X., Liu, Z., Sims, A., Wang, H., Pang, T., Li, C., Wang, L., Lin, M., and Du, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:58.082657Z"},"links":{"citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:6382f7d1edb362568b47dc4e863f7aacbc73e4cb2d01538966e4dbdb14592212","observation_id":"60c549bd-ce14-43bf-b44b-f2a72e3a1bf3","resolution":{"observed_at":"2026-08-03T16:43:58.082657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-03T16:43:58.144921Z","title":"org/abs/2504.16084","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:58.144921Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:aa4a477cff3d4ee8b8ad643bb2f5924aec7016b1660a0b53e0ef1890fc992fd9","observation_id":"44544868-b68d-4992-bbe6-c746fd65ae14","resolution":{"observed_at":"2026-08-03T16:43:58.144921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.00519","last_updated":"2016-11-07T17:29:24Z","snapshot_observed_at":"2026-08-03T00:53:42.965029Z","submitted_at":"2015-09-01T22:33:13Z","title":"Importance Weighted Autoencoders","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.00519","snapshot_observed_at":"2026-08-03T16:43:54.075263Z","title":"org/abs/1509.00519","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.075263Z"},"links":{"cited_paper":"/paper/1509.00519","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:e5ab2497a4fb93b3ccca2968db77241d58d12ffeba7d508e5181e52b4bae0f71","observation_id":"7358163e-dae2-4d17-86cb-5f3ed4e362ae","resolution":{"observed_at":"2026-08-03T16:43:54.075263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-02T16:52:38.363314Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-03T16:43:55.921050Z","title":"Ma, X., Liu, Q., Jiang, D., Zhang, G., Ma, Z., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:55.921050Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:6e930967a5b1e7d303d9bf3c95c1fe9526c0a4d10a85b501f3b0f816fb5dd41d","observation_id":"f7cb0a4a-63d4-41e5-bbd3-3ede3214bafc","resolution":{"observed_at":"2026-08-03T16:43:55.921050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05343","last_updated":"2019-11-13T08:11:42Z","snapshot_observed_at":"2026-07-06T08:36:38.690634Z","submitted_at":"2019-11-13T08:11:42Z","title":"A Stable Variational Autoencoder for Text Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05343","snapshot_observed_at":"2026-08-03T16:43:55.552728Z","title":"Lightman, H., Kosaraju, V ., Burda, Y ., Edwards, H., Baker, B., Lee, T., Leike, J., Schulman, J., Sutskever, I., and Cobbe, K","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:55.552728Z"},"links":{"cited_paper":"/paper/1911.05343","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:598e1fbc45af04a701669a3dfb66489e84085a565fdd68b3907fb2caba8ef32d","observation_id":"c261e508-4925-434a-9d17-c4254acb339f","resolution":{"observed_at":"2026-08-03T16:43:55.552728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-03T16:43:55.056382Z","title":"Hu, J., Wu, X., Zhu, Z., Xianyu, Wang, W., Zhang, D., and Cao, Y","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:55.056382Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:49935e95b0dd1a024f21f765c0f8ef51a467847f0b146123498fffae8baced27","observation_id":"2ce08a28-16e3-462b-afe8-c0500fc395d6","resolution":{"observed_at":"2026-08-03T16:43:55.056382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08285","last_updated":"2022-04-18T22:03:40Z","snapshot_observed_at":"2026-08-04T10:23:26.860467Z","submitted_at":"2021-07-17T17:09:18Z","title":"Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08285","snapshot_observed_at":"2026-08-03T16:43:54.214636Z","title":"Chen, C., Liu, Z., Du, C., Pang, T., Liu, Q., Sinha, A., Varakantham, P., and Lin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.214636Z"},"links":{"cited_paper":"/paper/2107.08285","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:4926c1364717c11c43dc7d3a7dfe9a9e27d664e3cc87ebf8c5d9b92e4d070812","observation_id":"7cb0e51f-c2a5-4a38-9c2a-988bb9120003","resolution":{"observed_at":"2026-08-03T16:43:54.214636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12524","last_updated":"2023-12-06T03:02:45Z","snapshot_observed_at":"2026-08-09T22:04:41.811623Z","submitted_at":"2023-05-21T17:51:35Z","title":"TheoremQA: A Theorem-driven Question Answering dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12524","snapshot_observed_at":"2026-08-03T16:43:54.710371Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.710371Z"},"links":{"cited_paper":"/paper/2305.12524","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:dc26c43b51001916535a0283ebee5a62ae4ed49b18d48a2af400477c565e3bb9","observation_id":"c0545efa-1a4e-4f6a-8a2b-a39b66788a1a","resolution":{"observed_at":"2026-08-03T16:43:54.710371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-07-06T19:46:24.121362Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-08-03T16:43:54.497117Z","title":"Chen, W., Yin, M., Ku, M., Lu, P., Wan, Y ., Ma, X., Xu, J., Wang, X., and Xia, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.497117Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:81ddbdef79047854f3106be129e34e649bd44a765756b23bee3eccba886b47ac","observation_id":"e026c71f-ed98-4660-954a-bb8ca40016ef","resolution":{"observed_at":"2026-08-03T16:43:54.497117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09760","last_updated":"2025-03-07T15:26:03Z","snapshot_observed_at":"2026-07-06T18:30:50.693663Z","submitted_at":"2024-06-14T06:57:18Z","title":"Bootstrapping Language Models with DPO Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09760","snapshot_observed_at":"2026-08-03T16:43:54.381657Z","title":"Chen, H., Feng, Y ., Liu, Z., Yao, W., Prabhakar, A., Hei- necke, S., Ho, R., Mui, P., Savarese, S., Xiong, C., and Wang, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:54.381657Z"},"links":{"cited_paper":"/paper/2406.09760","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:44dc938fcbb91ba2ac6d5038f05aa5b12d91adf14494c1ba4ae1fedbecc96787","observation_id":"5b33c3c0-dcd0-458f-92a1-1ca91077afc9","resolution":{"observed_at":"2026-08-03T16:43:54.381657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2512.12576."}