{"as_of":"2026-08-13T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06bf05ff5f54fe0b05a8e6d6e3685ab318db4724b968551a30defb7b5300bcb3","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:36.509160Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:36.029822Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-07T14:16:36.029822Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.029822Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:594d58768407533ec327cf82e2edd0a9077b5c2bf422f3eb1bb4833ed0d9be1d","observation_id":"e54ca4a9-5f34-48a3-bb04-952e8cce4afc","resolution":{"observed_at":"2026-08-07T14:16:36.029822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-06T16:17:42.986386Z","title":"Toward Scientific Rea- soning in LLMs: Training from Expert Discussions via Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13966","last_updated":"2025-09-01T20:28:13Z","snapshot_observed_at":"2026-08-10T18:40:51.438582Z","submitted_at":"2025-07-18T14:30:08Z","title":"Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:42.986386Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2507.13966"},"observation_digest":"sha256:0a3ce988341fc463ec26f47bc16784b722e736622b4ad74bd2372af3cc69970c","observation_id":"061e31b1-ba24-4b77-b94f-eef42f8dd929","resolution":{"observed_at":"2026-08-06T16:17:42.986386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:fc2a7a4c49b2023840c636f48f1de253b77940fef8031a55fe0d7ede4d35595c","observation_id":"836537d0-3232-4b45-9326-727cb0c321c3","resolution":{"observed_at":"2026-05-16T21:48:34.403311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2604.27351","last_updated":"2026-04-30T03:02:27Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:02:27Z","title":"Heterogeneous Scientific Foundation Model Collaboration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T08:50:05.980191Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2604.27351"},"observation_digest":"sha256:a99fdebc28ba8b704705c3dbefb025af3d1e8e6030012337ce20e34ff233ee20","observation_id":"35dc85c7-1183-4668-ac4d-9ddacfbfa3d3","resolution":{"observed_at":"2026-05-09T04:30:11.969332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2606.16517","last_updated":"2026-06-30T13:49:08Z","snapshot_observed_at":"2026-08-12T12:06:04.388020Z","submitted_at":"2026-06-15T10:19:49Z","title":"How Post-Training Shapes Biological Reasoning Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-01T07:48:31.110861Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2606.16517"},"observation_digest":"sha256:3ebc5d03cb73eff9f8b100b83e8d8dd08d10b8e9d7ac8ef5237d0b3e2cd880c6","observation_id":"ca5363fa-0429-4cc9-82e4-98d5859b14cb","resolution":{"observed_at":"2026-07-01T07:55:31.065267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19501/citation-record","integrity":"/paper/2505.19501/integrity","json":"/paper/2505.19501/citation-record.json","paper":"/paper/2505.19501"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:39.499322Z","title":"https://groups","venue":null,"work_id":"dddafe02-b091-495a-a7f9-e50b227aeae9","year":null},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.587229Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:adcfd4df115096dd045baf17f8ec6b38f3c43c5a21a625c586bef24823ef5bc7","observation_id":"afea2159-1a30-42ab-b491-9dbae7c6f438","resolution":{"observed_at":"2026-08-07T14:16:39.579019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03323","last_updated":"2019-06-20T20:41:58Z","snapshot_observed_at":"2026-08-11T08:24:54.476567Z","submitted_at":"2019-04-06T00:34:39Z","title":"Publicly Available Clinical BERT Embeddings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03323","snapshot_observed_at":"2026-08-07T14:16:32.630844Z","title":"Publicly available clinical bert embeddings","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.630844Z"},"links":{"cited_paper":"/paper/1904.03323","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:3b1afb5ee4e8fee14116432296ad15c27ad912075e9dec3018af2b773b288cb8","observation_id":"98928a95-ae8b-49ba-95c7-d9675e3662e6","resolution":{"observed_at":"2026-08-07T14:16:32.630844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.10676","last_updated":"2019-09-10T18:10:35Z","snapshot_observed_at":"2026-08-10T19:24:00.342521Z","submitted_at":"2019-03-26T05:11:46Z","title":"SciBERT: A Pretrained Language Model for Scientific Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.10676","snapshot_observed_at":"2026-08-07T14:16:32.723398Z","title":"Scibert: A pretrained language model for scientific text","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.723398Z"},"links":{"cited_paper":"/paper/1903.10676","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:0023a1cdddb947811d06d8a2c7372b221363894690023ec2ffeb7936d2d3ff63","observation_id":"ec5f7560-c4fe-4f4e-b909-30935d26a96c","resolution":{"observed_at":"2026-08-07T14:16:32.723398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01976","last_updated":"2024-10-18T06:52:17Z","snapshot_observed_at":"2026-08-13T04:04:08.673396Z","submitted_at":"2024-03-04T12:19:28Z","title":"SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01976","snapshot_observed_at":"2026-08-07T14:16:32.807425Z","title":"Sciassess: Benchmarking llm proficiency in scientific literature analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.807425Z"},"links":{"cited_paper":"/paper/2403.01976","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:2779639c62aa24cc5fe7366af33b42f4b9f7bb9ff987353bf5d6e6784408d87f","observation_id":"95578303-0a4e-43f2-8890-0b52b5acb70c","resolution":{"observed_at":"2026-08-07T14:16:32.807425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-08-13T04:19:22.554159Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T14:16:32.906989Z","title":"Maxmin-rlhf: Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.906989Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:a8a135edb546b1888758b1f54b956c948fe5c99900f8ef343bec50deb5ded7ed","observation_id":"e4b22f4d-898f-4f46-9fba-5bcad3ffbc6f","resolution":{"observed_at":"2026-08-07T14:16:32.906989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:39.306230Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"97f04a1e-b77c-4f04-8a41-4756854dce4e","year":2017},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.000519Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:3623c96bcdad9fb1962751d49ced1bb62de0862017289f8981716c5255df337d","observation_id":"83a7ae87-6a9a-46b3-ac06-a3b7d5c2023c","resolution":{"observed_at":"2026-08-07T14:16:39.374637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:39.019320Z","title":"A 5′ utr language model for decoding untranslated regions of mrna and function predictions","venue":null,"work_id":"cb3d5793-8f94-4e3d-b927-37e27b40a517","year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.064419Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:14cf7f9634ab7b432d0b9cbc69c2d5abadf2577d4d940d4551dcd89419c35ed9","observation_id":"75646ddd-da90-4e10-8468-4bf1706831ad","resolution":{"observed_at":"2026-08-07T14:16:39.099082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:16:33.136460Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.136460Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:e91246f7bf8bc3d2235198284b381023d5f5fd9ee3dbac85ff2262e501deea21","observation_id":"1918dbac-c09e-49cf-bc17-08613e799728","resolution":{"observed_at":"2026-08-07T14:16:33.136460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14495","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:37.529348Z","title":"Temporal consistency for llm reasoning process error identification","venue":null,"work_id":"e02b1f7b-92ed-428e-bc08-e55dc6a3d351","year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.252728Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:23794cb47b165aaae207d57d2e2ab2b03f96b2c9aa5913fa8dc135257ef2a70a","observation_id":"a7ef9dc2-1148-494b-bc6c-906cf4dcb15e","resolution":{"observed_at":"2026-08-07T14:16:37.578310Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12482","last_updated":"2024-05-23T06:29:00Z","snapshot_observed_at":"2026-08-13T00:50:37.004905Z","submitted_at":"2024-03-19T06:39:47Z","title":"Embodied LLM Agents Learn to Cooperate in Organized Teams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12482","snapshot_observed_at":"2026-08-07T14:16:33.324986Z","title":"Embodied llm agents learn to cooperate in organized teams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.324986Z"},"links":{"cited_paper":"/paper/2403.12482","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:2b580049897836661fe7349eabfafc863d071dc9230b9a5fd4974d31cfc03682","observation_id":"3ff156e0-1d28-4814-a7ca-3c65c51b2479","resolution":{"observed_at":"2026-08-07T14:16:33.324986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.880726Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations","venue":null,"work_id":"44ef7218-4f46-48dd-b899-52c19090c346","year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.400906Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:fe4b2806c5d3163958637cfeaacbcff15add69154759c058ffddfa5c0ba4ef1a","observation_id":"64f9b7dc-1b6b-405d-833b-2162ea59247f","resolution":{"observed_at":"2026-08-07T14:16:38.936618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.723685Z","title":"Crispr-gpt: An llm agent for automated design of gene-editing experiments","venue":null,"work_id":"f667181e-b064-4639-a74d-6c24da23e092","year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.487464Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:4968436bd7a9c5fdf8f2d5f370cbf9efa93f81bbabe2b37b47d0350f1c402f47","observation_id":"24d7bf2b-47c5-4494-b0a8-a3bbcfec2ef8","resolution":{"observed_at":"2026-08-07T14:16:38.786177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T14:16:33.563390Z","title":"A survey on large language models for code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.563390Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:830fd9e49c8fd449c678eca1512b7d89cad92176cc786729c3f6c53710c6f357","observation_id":"ac6f6e28-6b99-4c06-a28e-2d2507c3c7ea","resolution":{"observed_at":"2026-08-07T14:16:33.563390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.585263Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":"1ca55cfe-fcf3-4266-86e1-e1998a6e8274","year":2021},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.651898Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:e542a67e8ce2e5ad8f81f4aa6de6d8736059d6e464ca84ea05e7cc77dc15e110","observation_id":"d6eafb56-a2a7-4cfc-8e9c-54abbfa772b6","resolution":{"observed_at":"2026-08-07T14:16:38.645884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-08-13T00:36:57.540362Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-07T14:16:33.769378Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.769378Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:51b0640d99204325c9dbbd84ac89ffc4fbe09288c06de91b030dd0ec299c9aa9","observation_id":"f33a9524-a96c-4116-884a-000a202120a4","resolution":{"observed_at":"2026-08-07T14:16:33.769378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.431917Z","title":"Bioasq-qa: A manually curated corpus for biomedical question answering","venue":null,"work_id":"6d8edb6e-713c-46bd-8419-831551cfa4ff","year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.839083Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:334630677f047da0e9888b6f22eae4ad05e223cb2c7de999d17e59a43db48d41","observation_id":"1cdd6523-8ddc-4899-b1e9-b1baf5e61344","resolution":{"observed_at":"2026-08-07T14:16:38.500172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T14:16:33.944484Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.944484Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:ca86f2dd22444c13e44377093ab14cd6517032652e78358b21cec95343e21705","observation_id":"b7fa524b-9938-4b67-87b6-074d9acbade0","resolution":{"observed_at":"2026-08-07T14:16:33.944484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T14:16:34.024067Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.024067Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:24ac8c37e397e077e008c394c915d3f768462804a909720f8ecc70090e4f9823","observation_id":"2b06293d-b9af-4ed1-ae10-8ded4e7c4f18","resolution":{"observed_at":"2026-08-07T14:16:34.024067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10362","last_updated":"2024-07-17T17:28:36Z","snapshot_observed_at":"2026-08-12T00:26:27.857559Z","submitted_at":"2024-07-14T23:52:25Z","title":"LAB-Bench: Measuring Capabilities of Language Models for Biology Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10362","snapshot_observed_at":"2026-08-07T14:16:34.099327Z","title":"Lab-bench: Measuring capabilities of language models for biology research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.099327Z"},"links":{"cited_paper":"/paper/2407.10362","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:b3e12cd103216277093f6e03b9aac04763fe9992d817a35900d97eb5ae3b17bd","observation_id":"5a98f1ac-515c-4c98-8df5-36f402dc2723","resolution":{"observed_at":"2026-08-07T14:16:34.099327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:34.189406Z","title":"Biobert: a pre-trained biomedical language representation model for biomedical text mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.189406Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:57900bdd85e8699476b321f5ceccb3378ae255153c7d845a3a7ceddff9f6f783","observation_id":"77bbd0b2-17ea-4458-9a67-bf64eef549bc","resolution":{"observed_at":"2026-08-07T14:16:34.189406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01268","last_updated":"2024-04-01T17:45:15Z","snapshot_observed_at":"2026-08-13T00:39:56.724504Z","submitted_at":"2024-04-01T17:45:15Z","title":"Mapping the Increasing Use of LLMs in Scientific Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01268","snapshot_observed_at":"2026-08-07T14:16:34.285798Z","title":"Mapping the increasing use of llms in scientific papers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.285798Z"},"links":{"cited_paper":"/paper/2404.01268","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:c8f9a7223494c8b10f39a234eece9f1bb78ced1faf255d623b96545ba9baa09b","observation_id":"e6a6037e-1978-4a79-95c8-48a164660ba6","resolution":{"observed_at":"2026-08-07T14:16:34.285798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-12T02:21:51.598634Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:16:34.365003Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.365003Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:9a497da6b78c07a1bed7bad7eafec36dcc8be1af3c86214d6149e4fb21079864","observation_id":"33172ea8-d605-4bde-a5d1-e304650e5cb8","resolution":{"observed_at":"2026-08-07T14:16:34.365003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.260821Z","title":"Biogpt: generative pre-trained transformer for biomedical text generation and mining","venue":null,"work_id":"1b0ff854-9f9e-420a-b199-14d704fa2a4c","year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.436232Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:7bee07cfbf7de7f1b0dc35bfe01addc8900302ad8e81e49b5203185fb007d314","observation_id":"f8694ac4-f500-4491-96bc-cfff4e84cfcf","resolution":{"observed_at":"2026-08-07T14:16:38.339770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09442","last_updated":"2023-08-21T07:49:37Z","snapshot_observed_at":"2026-08-12T05:58:15.203453Z","submitted_at":"2023-08-18T10:14:35Z","title":"BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09442","snapshot_observed_at":"2026-08-07T14:16:34.525450Z","title":"Biomedgpt: Open multimodal generative pre-trained transformer for biomedicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.525450Z"},"links":{"cited_paper":"/paper/2308.09442","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:2c6261df900cd09216092eb6ef5c92d646dd4e17af429a2c15415c7b0f96faee","observation_id":"61c29d7e-f8ba-48c3-9696-7523461a9b8a","resolution":{"observed_at":"2026-08-07T14:16:34.525450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.107352Z","title":"Covid-qa: A question answering dataset for covid-19","venue":null,"work_id":"ce51074c-3929-49ee-bcfc-ca6c1d7cf4ea","year":2020},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.619750Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:4d473ec58a5dd0e8e5a2872d9fc215984d805cfc87c57658b68e7dfe0543b8b2","observation_id":"6a9d5b13-ca7d-4bd3-86df-09cefabe942b","resolution":{"observed_at":"2026-08-07T14:16:38.178198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:37.973246Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"b33fda37-fc31-49b2-859f-7d7169ba4f65","year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.712194Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:db63fef5c3d8bbbc9cfef36037ec69ceb8d8c429275ae6dbeeba9e1a81ff87eb","observation_id":"212554fe-81aa-4ae6-826e-3be54a7976f7","resolution":{"observed_at":"2026-08-07T14:16:38.027226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:34.770907Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.770907Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:fbeba2ec4c80ad4a4abe0c05043968a6ba5ceee34b0c85320f96cadc11a87917","observation_id":"ec343161-45bc-43cb-ba87-66f2b60092bd","resolution":{"observed_at":"2026-08-07T14:16:34.770907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:37.823318Z","title":"A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research","venue":null,"work_id":"9bab4c9c-21de-4cc4-81ca-dcfecf631743","year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.829896Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:1ed1af6b63eb40c421b7e2f3add77b2cb53df33377a73eb90edeb1e0f51f8f1b","observation_id":"77d25e6f-a006-435a-be4b-15f8fd6de7a2","resolution":{"observed_at":"2026-08-07T14:16:37.871064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T14:16:34.919303Z","title":"Humanity’s last exam","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.919303Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:6f8f2d3b869302ea148a15c71c98750485c76db38ef73806a477cf8b4fb91a1f","observation_id":"1153b7b9-16d3-4381-8ba0-ecd68bac0d78","resolution":{"observed_at":"2026-08-07T14:16:34.919303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03598","last_updated":"2021-05-28T06:09:23Z","snapshot_observed_at":"2026-08-12T11:55:15.843614Z","submitted_at":"2021-05-28T06:09:23Z","title":"SciFive: a text-to-text transformer model for biomedical literature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03598","snapshot_observed_at":"2026-08-07T14:16:35.015805Z","title":"Scifive: a text-to-text transformer model for biomedical literature","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.015805Z"},"links":{"cited_paper":"/paper/2106.03598","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:8ed7d64e7bd57fcdb9582e17659a3ffecc8e4cb233804646dd2f73deee977b7e","observation_id":"c6f1273f-6232-412d-8f21-579df929b853","resolution":{"observed_at":"2026-08-07T14:16:35.015805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17604","last_updated":"2025-04-22T20:31:48Z","snapshot_observed_at":"2026-08-11T22:47:55.374770Z","submitted_at":"2025-03-22T01:18:59Z","title":"OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17604","snapshot_observed_at":"2026-08-07T14:16:35.092269Z","title":"Omniscience: A domain-specialized llm for scientific reasoning and discovery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.092269Z"},"links":{"cited_paper":"/paper/2503.17604","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:69643214a0a9c41e8069816a75056f576baf67d3be51a94b52c81d0605d9494f","observation_id":"398dcbeb-5310-4dbe-bf77-71a92d4be9d6","resolution":{"observed_at":"2026-08-07T14:16:35.092269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.171091Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.171091Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:8930c5367c0ef5c28446d0ecd17101921b6ef6eae347d385f8ef837ba92839c1","observation_id":"01f58c65-b194-47b9-bdd7-73f99773a326","resolution":{"observed_at":"2026-08-07T14:16:35.171091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:16:35.239501Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.239501Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:50df20b6e470c42dff0659befdce1e5f7d71f366537f463b29c9717b47005c41","observation_id":"f1dbd3a9-b21d-4d71-ab50-a65683f5700f","resolution":{"observed_at":"2026-08-07T14:16:35.239501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:16:35.320838Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.320838Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:b963e1db74ad61c043666b3bf972c93f8a201a842f7ff157062d4a6daee419b6","observation_id":"53a1d2b6-08e4-4829-8fe3-83f970070603","resolution":{"observed_at":"2026-08-07T14:16:35.320838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.377873Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.377873Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:5624dca0177e2578a31b3f27b0690b54515fe399428fddbd30859f627bacbec5","observation_id":"d0279c49-b79e-457c-9f38-f64049913834","resolution":{"observed_at":"2026-08-07T14:16:35.377873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T14:16:35.431025Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.431025Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:e0ba76804066190d15ff831ed5a71119334f6189a2a401596197087788e68e06","observation_id":"e2d81dc0-19e9-4631-953a-61b9f0b2d066","resolution":{"observed_at":"2026-08-07T14:16:35.431025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-07T14:16:35.497267Z","title":"Galactica: A large language model for science","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.497267Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:8ea4d99fa6a5943adf3fa1994dc1656dbe45cb8fa617649c84927d735866af98","observation_id":"11ccb532-811a-4fa2-a7c2-9f49545af144","resolution":{"observed_at":"2026-08-07T14:16:35.497267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.578517Z","title":"A call for built-in biosecurity safeguards for generative ai tools","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.578517Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:65d0b5684c6d7f9ebeb91e215670537f36d7fca92bcb6a55f085a5491695719d","observation_id":"00e70ae3-52f4-48ff-9b2c-d3a0eb1a415b","resolution":{"observed_at":"2026-08-07T14:16:35.578517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.641355Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.641355Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:9e52c7bfb4d5069265837cdf569df9bd720f19ac0d50b526e6c9ec72a4e58b7f","observation_id":"5a8f5076-31cb-4081-a8a1-dd64cc10cea3","resolution":{"observed_at":"2026-08-07T14:16:35.641355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-08-10T22:06:14.951132Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-08-07T14:16:35.711109Z","title":"Pairwise proximal policy optimization: Harnessing relative feedback for llm alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.711109Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:9b99b26232c7f26f252977f3c88ec62c7b186038a90ae5498b8cc54a671fa7dc","observation_id":"7f645668-9c8f-4882-b23b-0fe5ee70045a","resolution":{"observed_at":"2026-08-07T14:16:35.711109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13565","last_updated":"2023-08-25T01:40:48Z","snapshot_observed_at":"2026-08-12T14:33:45.712345Z","submitted_at":"2023-08-25T01:40:48Z","title":"DARWIN Series: Domain Specific Large Language Models for Natural Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13565","snapshot_observed_at":"2026-08-07T14:16:35.778875Z","title":"Darwin series: Domain specific large language models for natural science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.778875Z"},"links":{"cited_paper":"/paper/2308.13565","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:89fcf4809a3a9696245d571cf59cb2b76f19fb8d4299f0a776c8cabdcf660a5a","observation_id":"b5447346-bd0c-432b-8df5-a6d32676b0b1","resolution":{"observed_at":"2026-08-07T14:16:35.778875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T14:16:35.860086Z","title":"A minimalist approach to llm reasoning: From rejection sampling to reinforce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.860086Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:dc1bc8ad6a1528ab2e0641190ed066b9cb18e0371b1bae2343477f51d58fa096","observation_id":"bc56ceb1-ca1e-45ab-a9e7-534e7fc3ea92","resolution":{"observed_at":"2026-08-07T14:16:35.860086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-08-12T03:51:31.598735Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-08-07T14:16:35.917247Z","title":"Reasonflux: Hierarchical llm reasoning via scaling thought templates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.917247Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:fb1bc2ddd7e3a3d7180ab0d3a823ae6c72f966dfe5a17e5b26230f62da26a2cc","observation_id":"bc33c128-912a-46f2-b9d8-2183cc8c76cf","resolution":{"observed_at":"2026-08-07T14:16:35.917247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03540","last_updated":"2022-12-16T22:20:33Z","snapshot_observed_at":"2026-08-09T10:04:20.510076Z","submitted_at":"2022-02-02T14:28:51Z","title":"GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03540","snapshot_observed_at":"2026-08-07T14:16:35.973838Z","title":"Smith, Christopher Parisien, Colin Compas, Cheryl Martin, Mona G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.973838Z"},"links":{"cited_paper":"/paper/2203.03540","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:b7694029286035714ef36a4a8bc202ac79069b58b9ecd904edb1f1bd7fb48def","observation_id":"092e32ff-81b6-4a4c-b27c-8426ce22c4ec","resolution":{"observed_at":"2026-08-07T14:16:35.973838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-07T14:16:36.029822Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.029822Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:594d58768407533ec327cf82e2edd0a9077b5c2bf422f3eb1bb4833ed0d9be1d","observation_id":"e54ca4a9-5f34-48a3-bb04-952e8cce4afc","resolution":{"observed_at":"2026-08-07T14:16:36.029822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:16:36.086883Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.086883Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:4ab891ef721c8ad59253a61ccde0b6433b45ef5e5d6a697153e69de985d8c9f6","observation_id":"a53ce49d-145b-4e6a-ac43-cc76e727053d","resolution":{"observed_at":"2026-08-07T14:16:36.086883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03905","last_updated":"2022-04-22T07:47:42Z","snapshot_observed_at":"2026-07-06T12:58:09.665774Z","submitted_at":"2022-04-08T08:07:42Z","title":"BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model","version":2},"cited_work":{"arxiv_id":"2204.03905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03905","snapshot_observed_at":"2026-08-07T14:16:36.692059Z","title":"BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model","venue":"cs.CL","work_id":"d6a04b42-6dbd-4b2f-a3d7-4f806d094e23","year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.154616Z"},"links":{"cited_paper":"/paper/2204.03905","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:16ecf10c52f0e1278f0a6fd48468a4f4078c2ca0927b9ebf3d8bf0763f376fb6","observation_id":"82e82881-5bed-4ba4-b91c-2b451aba0c5c","resolution":{"observed_at":"2026-08-07T14:16:36.808890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:36.214381Z","title":"A generalist vision–language foundation model for diverse biomedical tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.214381Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:c6f231050b45b83cd5e8a4a77804157e191968e22bc0da0fd0682f690e362f32","observation_id":"2c79a4eb-c102-4f33-bc36-b20ffc301b21","resolution":{"observed_at":"2026-08-07T14:16:36.214381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:36.302753Z","title":"Scientific large language models: A survey on biological & chemical domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.302753Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:4e27e18f0e5032672e0fbbbf17feda6f9f4c68603cb163934c755cb32a423f6f","observation_id":"f38840b1-f1c2-48c1-a399-4e3266f637bd","resolution":{"observed_at":"2026-08-07T14:16:36.302753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-13T00:19:13.755361Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T14:16:36.509160Z","title":"Genome Engineering using CRISPR/- Cas Systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.509160Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:2201ef0d0db1da2c9b8a32e798fbde7ee9dea03d9fe0ce6bd42e82375ba7aac9","observation_id":"d3bbb883-9740-4886-bf2b-91166959f7c4","resolution":{"observed_at":"2026-08-07T14:16:36.509160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.19501."}