Pith. sign in

Paper Citation Record · LEDGER

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.19501.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19501 v2

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:16:36.509160Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:16:36.029822Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

50 of 50 outbound references displayed

  • verified exact2
  • verified fuzzy11
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation afea2159-1a30-42ab-b491-9dbae7c6f438 · outbound

This paper cites https://groups.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning https://groups

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.579019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:32.587229Z digest=sha256:88de9a99626c5deb8f89745ca965a3361d30077217a096cab757f19cfc5365b6

Observation 98928a95-ae8b-49ba-95c7-d9675e3662e6 · outbound

This paper cites Publicly Available Clinical BERT Embeddings.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Publicly Available Clinical BERT Embeddings

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.630844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.630844Z digest=sha256:ce0ae3ba2c77587ba62a2f5ec56f1d4b0f36d0dd5c5fb39f29fadbb58be2ff35

Observation ec5f7560-c4fe-4f4e-b909-30935d26a96c · outbound

This paper cites SciBERT: A Pretrained Language Model for Scientific Text.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciBERT: A Pretrained Language Model for Scientific Text

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.723398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.723398Z digest=sha256:0d34a222be0abab37dbc9bc8ea6f54c0027cf7786c6211867867465c4e5c8c4a

Observation 95578303-0a4e-43f2-8890-0b52b5acb70c · outbound

This paper cites SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.807425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.807425Z digest=sha256:aa11ee3007a7fb00117eba0c89986417fba798fbbd6da30e37808a7e1c3e06b7

Observation e4b22f4d-898f-4f46-9fba-5bcad3ffbc6f · outbound

This paper cites MaxMin-RLHF: Alignment with Diverse Human Preferences.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning MaxMin-RLHF: Alignment with Diverse Human Preferences

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.906989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.906989Z digest=sha256:96bf8ab58daeec46a90304f99f2b0b7047cfe95a49dea36ec9378d6f8a6fcce0

Observation 83a7ae87-6a9a-46b3-ac06-a3b7d5c2023c · outbound

This paper cites Deep reinforcement learning from human preferences.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Deep reinforcement learning from human preferences

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.374637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.000519Z digest=sha256:daf86206f42eb3664cd09bda70bb78ceb74d06bb2fb89c8f93de0985064c6e95

Observation 75646ddd-da90-4e10-8468-4bf1706831ad · outbound

This paper cites A 5′ utr language model for decoding untranslated regions of mrna and function predictions.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A 5′ utr language model for decoding untranslated regions of mrna and function predictions

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.099082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.064419Z digest=sha256:ed545991b0d9a12a04ef4b06361be6b67b9f67d8ebf04a40f7a21bdfeaa19324

Observation 1918dbac-c09e-49cf-bc17-08613e799728 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.136460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.136460Z digest=sha256:2d1d4375ba34ce3119000ce1b25c3654361a61fc72606d0e7e49e1bbf9160c06

Observation a7ef9dc2-1148-494b-bc6c-906cf4dcb15e · outbound

This paper cites Temporal consistency for llm reasoning process error identification.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Temporal consistency for llm reasoning process error identification

Reference 9

Resolution
verified exact
raw_fallback, observed 2026-08-07T14:16:37.578310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.252728Z digest=sha256:33ba3de0a32361ce9418b4eb7aebaa86db14b9669dc72aec61f458bd95a3d93e

Observation 3ff156e0-1d28-4814-a7ca-3c65c51b2479 · outbound

This paper cites Embodied LLM Agents Learn to Cooperate in Organized Teams.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Embodied LLM Agents Learn to Cooperate in Organized Teams

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.324986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.324986Z digest=sha256:4d16653ea70decbe691a61f6d0f0355e8e2edebfdaac6303183df7ce237a1e15

Observation 64f9b7dc-1b6b-405d-833b-2162ea59247f · outbound

This paper cites Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.936618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.400906Z digest=sha256:c98702db1aa9d48abc5bc4108b15bf8dc1fdf2865bea56d330c8659fa0691285

Observation 24d7bf2b-47c5-4494-b0a8-a3bbcfec2ef8 · outbound

This paper cites Crispr-gpt: An llm agent for automated design of gene-editing experiments.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Crispr-gpt: An llm agent for automated design of gene-editing experiments

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.786177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.487464Z digest=sha256:f36c9d4a7b76ad5e3a181e86154f349103247de0e5819ef1ea3ff6ab7d7e361d

Observation ac6f6e28-6b99-4c06-a28e-2d2507c3c7ea · outbound

This paper cites A Survey on Large Language Models for Code Generation.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A Survey on Large Language Models for Code Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.563390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.563390Z digest=sha256:f8629411c0ddc86ee1bdc202dedfe819ebf34067dd826ab4e58b0c81b4f206b7

Observation d6eafb56-a2a7-4cfc-8e9c-54abbfa772b6 · outbound

This paper cites What disease does this patient have? a large-scale open domain question answering dataset from medical exams.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning What disease does this patient have? a large-scale open domain question answering dataset from medical exams

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.645884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.651898Z digest=sha256:1a9b993981502571971a3eb9d8a11441f5ddae898f9823b154b9507638bc8846

Observation f33a9524-a96c-4116-884a-000a202120a4 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.769378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.769378Z digest=sha256:56846cbb3462fff76b5891481cfe04904de3075eb2c74fe7a6b6f641abee951e

Observation 1cdd6523-8ddc-4899-b1e9-b1baf5e61344 · outbound

This paper cites Bioasq-qa: A manually curated corpus for biomedical question answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Bioasq-qa: A manually curated corpus for biomedical question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.500172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.839083Z digest=sha256:72a4c3255174909b57d1ac145d6344b6e1366376f3eaacb13821fdb8a29ffb22

Observation b7fa524b-9938-4b67-87b6-074d9acbade0 · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Training Language Models to Self-Correct via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.944484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.944484Z digest=sha256:3953545615190b8f86f703b2458b7579f49e752749f15f19de6ee414ecd74f09

Observation 2b06293d-b9af-4ed1-ae10-8ded4e7c4f18 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.024067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.024067Z digest=sha256:9b16fd5ab2f1346ab6fe1b4cd0659f2789e050485a36e081ddba638549598a99

Observation 5a98f1ac-515c-4c98-8df5-36f402dc2723 · outbound

This paper cites LAB-Bench: Measuring Capabilities of Language Models for Biology Research.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning LAB-Bench: Measuring Capabilities of Language Models for Biology Research

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.099327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.099327Z digest=sha256:00684778002d1f3b0aa1462f02c5b8f9a6b2b04e8aff640ff1a7e400abcde6ee

Observation 77bbd0b2-17ea-4458-9a67-bf64eef549bc · outbound

This paper cites Biobert: a pre-trained biomedical language representation model for biomedical text mining.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Biobert: a pre-trained biomedical language representation model for biomedical text mining

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.189406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.189406Z digest=sha256:6842d098fdaf359f6f887c7662568dce5641b399fe7aa4b0e93c7261b9bc8a5b

Observation e6a6037e-1978-4a79-95c8-48a164660ba6 · outbound

This paper cites Mapping the Increasing Use of LLMs in Scientific Papers.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Mapping the Increasing Use of LLMs in Scientific Papers

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.285798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.285798Z digest=sha256:b3f8d29b8e9e96e2362323872457c1653089351c5d1a226732260647f0d824aa

Observation 33172ea8-d605-4bde-a5d1-e304650e5cb8 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Understanding R1-Zero-Like Training: A Critical Perspective

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.365003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.365003Z digest=sha256:f6475f04ac92e034a1d6f1f99302211e8ce52c33294212805065e5a003b8bcda

Observation f8694ac4-f500-4491-96bc-cfff4e84cfcf · outbound

This paper cites Biogpt: generative pre-trained transformer for biomedical text generation and mining.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Biogpt: generative pre-trained transformer for biomedical text generation and mining

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.339770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.436232Z digest=sha256:d2b73a275f263b4e0387207127d8f8b598a50626e62fd6cc79ef3bad8008dc7e

Observation 61c29d7e-f8ba-48c3-9696-7523461a9b8a · outbound

This paper cites BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.525450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.525450Z digest=sha256:754797f2e0803dc7d0c695df930400f08ee5b86a8cb3a57556f5fd9d518c850b

Observation 6a9d5b13-ca7d-4bd3-86df-09cefabe942b · outbound

This paper cites Covid-qa: A question answering dataset for covid-19.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Covid-qa: A question answering dataset for covid-19

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.178198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.619750Z digest=sha256:03761c04f9a5de5c60b9cca0794abf88804be9ba54144204066fdc89f5bde579

Observation 212554fe-81aa-4ae6-826e-3be54a7976f7 · outbound

This paper cites Training language models to follow instructions with human feedback.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Training language models to follow instructions with human feedback

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.027226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.712194Z digest=sha256:cf25d1d91fe5816cbba5427a48c9e50e6582bbd300363f8d0fab32b6ab50c3bf

Observation ec343161-45bc-43cb-ba87-66f2b60092bd · outbound

This paper cites Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.770907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.770907Z digest=sha256:8a1e6fdca9dfec2c7e1c66a307bb7758be1c620a5a36145d9ae4704d13b3c971

Observation 77d25e6f-a006-435a-be4b-15f8fd6de7a2 · outbound

This paper cites A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:37.871064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.829896Z digest=sha256:b6db26f0fc863192f226814a82df251129f83834a8799a225d709a8d76e44a47

Observation 1153b7b9-16d3-4381-8ba0-ecd68bac0d78 · outbound

This paper cites Humanity's Last Exam.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Humanity's Last Exam

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.919303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.919303Z digest=sha256:136439d4e4ff31b6b22d3ae39155bfce14e34271805e116f668dc9a4ba3f0d4b

Observation c6f1273f-6232-412d-8f21-579df929b853 · outbound

This paper cites SciFive: a text-to-text transformer model for biomedical literature.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciFive: a text-to-text transformer model for biomedical literature

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.015805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.015805Z digest=sha256:48aed36dc8b93ef2f09c6e46bb5310c49110344fcafae521db4bf367282fdc7b

Observation 398dcbeb-5310-4dbe-bf77-71a92d4be9d6 · outbound

This paper cites OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.092269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.092269Z digest=sha256:6710b12b89262dba543e76433d6cb8c7761a06d5b19a0338876c16fd0965b938

Observation 01f58c65-b194-47b9-bdd7-73f99773a326 · outbound

This paper cites Gpqa: A graduate-level google-proof q&a benchmark.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Gpqa: A graduate-level google-proof q&a benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.171091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.171091Z digest=sha256:cbe7ad921c736eb68db4bcaf399997e6c50e46efeec068d26403e46a69b88d30

Observation f1dbd3a9-b21d-4d71-ab50-a65683f5700f · outbound

This paper cites Proximal Policy Optimization Algorithms.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.239501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.239501Z digest=sha256:f8474b104f29883790c4d9aa669ee6839a2cd2dba28c2dbebc03f6d649775d4a

Observation 53a1d2b6-08e4-4829-8fe3-83f970070603 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.320838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.320838Z digest=sha256:4089115cd6e7b8e586600989ee87ef694a2a01e71be6909c78d5ff335dfa26f2

Observation d0279c49-b79e-457c-9f38-f64049913834 · outbound

This paper cites Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.377873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.377873Z digest=sha256:521a3a8dd8f191dae0a51e4126c0053afa5e276ae225e69d67c1201abc4aa8d8

Observation e2d81dc0-19e9-4631-953a-61b9f0b2d066 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.431025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.431025Z digest=sha256:42462b2fb9aba53c9890547867bb7598af740cd9cda9f3a33ec45b8189ace74f

Observation 11ccb532-811a-4fa2-a7c2-9f49545af144 · outbound

This paper cites Galactica: A Large Language Model for Science.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Galactica: A Large Language Model for Science

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.497267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.497267Z digest=sha256:0e4bd6ce0824acfc495027f98d2a856a616b4d9427440cff2cafd689006dd807

Observation 00e70ae3-52f4-48ff-9b2c-d3a0eb1a415b · outbound

This paper cites A call for built-in biosecurity safeguards for generative ai tools.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A call for built-in biosecurity safeguards for generative ai tools

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.578517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.578517Z digest=sha256:d902d3582677f94863ccccbaeaec8f673e76880af375692ff3b0efaa7d3863a7

Observation 5a8f5076-31cb-4081-a8a1-dd64cc10cea3 · outbound

This paper cites Math-shepherd: Verify and reinforce llms step-by-step without human annotations.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Math-shepherd: Verify and reinforce llms step-by-step without human annotations

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.641355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.641355Z digest=sha256:fe391191aab631058d465ca0239cc9ae2912cb5618030315f51f442741511f68

Observation 7f645668-9c8f-4882-b23b-0fe5ee70045a · outbound

This paper cites Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.711109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.711109Z digest=sha256:4c1963163b39ba4c899985ac062f6c124fefedb27c57def080af6bc93a42e008

Observation b5447346-bd0c-432b-8df5-a6d32676b0b1 · outbound

This paper cites DARWIN Series: Domain Specific Large Language Models for Natural Science.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DARWIN Series: Domain Specific Large Language Models for Natural Science

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.778875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.778875Z digest=sha256:06a3525f07ffa01cbc28bb031828c93dd687ed742ad6fcf0023df8ff94a25a76

Observation bc56ceb1-ca1e-45ab-a9e7-534e7fc3ea92 · outbound

This paper cites A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.860086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.860086Z digest=sha256:fe9c3c7f8025ebf22821ca780ee4ce77fa9484aba87ad0202093e8d4cc93cdb7

Observation bc33c128-912a-46f2-b9d8-2183cc8c76cf · outbound

This paper cites ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.917247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.917247Z digest=sha256:534f03fc6651c87d5f300dc8bc507bf9637e2f289ad5292aae5c448a2ab1c459

Observation 092e32ff-81b6-4a4c-b27c-8426ce22c4ec · outbound

This paper cites GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.973838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.973838Z digest=sha256:f0f0cd8d3f2872c78f5d4333de17db84526977dbef4696cde3a2371297aa4b29

Observation e54ca4a9-5f34-48a3-bb04-952e8cce4afc · outbound

This paper cites Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.029822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.029822Z digest=sha256:8f7553994bc9bb1ed7e63bb77c94641215b7d7f17b8b0d3ed2f662794b9ce21b

Observation a53ce49d-145b-4e6a-ac43-cc76e727053d · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.086883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.086883Z digest=sha256:3880411915969309329af265aecc33a4d25cd77cc55137f3ebb2b444aed9ea32

Observation 82e82881-5bed-4ba4-b91c-2b451aba0c5c · outbound

This paper cites BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-08-07T14:16:36.808890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:36.154616Z digest=sha256:2f957762cb64543dea304df34d02313751ce0df9c51cfdb6f2dbc4dd3f177a22

Observation 2c79a4eb-c102-4f33-bc36-b20ffc301b21 · outbound

This paper cites A generalist vision–language foundation model for diverse biomedical tasks.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A generalist vision–language foundation model for diverse biomedical tasks

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.214381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.214381Z digest=sha256:2b29252aa602147baa28d770b260f44a8ed5c66ddc5fed60033f2b06ba970c5d

Observation f38840b1-f1c2-48c1-a399-4e3266f637bd · outbound

This paper cites Scientific large language models: A survey on biological & chemical domains.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Scientific large language models: A survey on biological & chemical domains

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.302753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.302753Z digest=sha256:8cce17468d62bb730a2ed778c69c23da757c6c4dbb7194adb78bfa4b45335e89

Observation d3bbb883-9740-4886-bf2b-91166959f7c4 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.509160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.509160Z digest=sha256:b3ca1e63f52b66c4414a408ebecfb1733536a6e6ed252ece5069ebc2010fc8c8

Pith citing papers

Observation e54ca4a9-5f34-48a3-bb04-952e8cce4afc · inbound

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning cites this paper.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.029822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.029822Z digest=sha256:8f7553994bc9bb1ed7e63bb77c94641215b7d7f17b8b0d3ed2f662794b9ce21b

Observation 061e31b1-ba24-4b77-b94f-eef42f8dd929 · inbound

Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need cites this paper.

Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-06T16:17:42.986386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:17:42.986386Z digest=sha256:05805a38637261ad822b7e28518c6d707a736dcfd213e46669761ceccbe1d720

Observation 836537d0-3232-4b45-9326-727cb0c321c3 · inbound

Evaluating Large Language Models in Scientific Discovery cites this paper.

Evaluating Large Language Models in Scientific Discovery Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-16T21:48:34.403311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-16T21:47:09.588941Z digest=sha256:ab22234810b7fb126565ea713f2c7e56e7f76af9615902355c53eabc03495fdd

Observation 35dc85c7-1183-4668-ac4d-9ddacfbfa3d3 · inbound

Heterogeneous Scientific Foundation Model Collaboration cites this paper.

Heterogeneous Scientific Foundation Model Collaboration Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-09T04:30:11.969332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-07T08:50:05.980191Z digest=sha256:25d7a2480a8b5edcf24b762496e1cfc48689d1d276b574fbed38729cc293327a

Observation ca5363fa-0429-4cc9-82e4-98d5859b14cb · inbound

How Post-Training Shapes Biological Reasoning Models cites this paper.

How Post-Training Shapes Biological Reasoning Models Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-07-01T07:55:31.065267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-01T07:48:31.110861Z digest=sha256:12c9af142fb90fea01b19010048731d73add71222681363ffa110f390950e3f8