Pith. sign in

Paper Citation Record · LEDGER

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

As of 19 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.19501.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19501 v2

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:16:36.509160Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:16:36.029822Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

50 of 50 outbound references displayed

  • verified exact2
  • verified fuzzy11
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation afea2159-1a30-42ab-b491-9dbae7c6f438 · outbound

This paper cites https://groups.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning https://groups

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.579019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:32.587229Z digest=sha256:648832940a2074280d5ba01f1095116ef125368b956c71eab303d1a89330e80e

Observation 98928a95-ae8b-49ba-95c7-d9675e3662e6 · outbound

This paper cites Publicly Available Clinical BERT Embeddings.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Publicly Available Clinical BERT Embeddings

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.630844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.630844Z digest=sha256:9e864a63a7a2cc51d93330cc5847175f1452804cbd25fb1593b8585f87804443

Observation ec5f7560-c4fe-4f4e-b909-30935d26a96c · outbound

This paper cites SciBERT: A Pretrained Language Model for Scientific Text.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciBERT: A Pretrained Language Model for Scientific Text

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.723398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.723398Z digest=sha256:45ae184b14a9e3132b14cdacb90d52b500729015a135a2876017f8c94eecf786

Observation 95578303-0a4e-43f2-8890-0b52b5acb70c · outbound

This paper cites SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.807425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.807425Z digest=sha256:734a47708f9c5431893428d6ce227ebb63052872b0b021d34d22fc58b5b27405

Observation e4b22f4d-898f-4f46-9fba-5bcad3ffbc6f · outbound

This paper cites MaxMin-RLHF: Alignment with Diverse Human Preferences.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning MaxMin-RLHF: Alignment with Diverse Human Preferences

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.906989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.906989Z digest=sha256:93be7d80ab235ed216ddab0cb3f2b2ee5362f23441aa072bb49699ccb9a43707

Observation 83a7ae87-6a9a-46b3-ac06-a3b7d5c2023c · outbound

This paper cites Deep reinforcement learning from human preferences.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Deep reinforcement learning from human preferences

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.374637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.000519Z digest=sha256:11dc2fff6b6258a605c20aa316055ae23022ba2e2c201cfd8f1f777d6566459d

Observation 75646ddd-da90-4e10-8468-4bf1706831ad · outbound

This paper cites A 5′ utr language model for decoding untranslated regions of mrna and function predictions.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A 5′ utr language model for decoding untranslated regions of mrna and function predictions

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.099082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.064419Z digest=sha256:96a27aa8c2c29732a28707e2c155b0e2a05d24e92eb9a3fd1edc60bd89cefe39

Observation 1918dbac-c09e-49cf-bc17-08613e799728 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.136460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.136460Z digest=sha256:d0e5790ebbc968fbcb9428f9b824f11b969abbc4be3e76751b8e79f3ef293fbf

Observation a7ef9dc2-1148-494b-bc6c-906cf4dcb15e · outbound

This paper cites Temporal consistency for llm reasoning process error identification.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Temporal consistency for llm reasoning process error identification

Reference 9

Resolution
verified exact
raw_fallback, observed 2026-08-07T14:16:37.578310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.252728Z digest=sha256:d50fe1757ba44d77992ed0e7bb35116b23aac8d060b6a85d4b9009c8f149005e

Observation 3ff156e0-1d28-4814-a7ca-3c65c51b2479 · outbound

This paper cites Embodied LLM Agents Learn to Cooperate in Organized Teams.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Embodied LLM Agents Learn to Cooperate in Organized Teams

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.324986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.324986Z digest=sha256:1a5160d41f3e0cff6cf8ac336ef8a0a7bcf0cf36cda814499261714daf334af8

Observation 64f9b7dc-1b6b-405d-833b-2162ea59247f · outbound

This paper cites Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.936618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.400906Z digest=sha256:0741d42eec30890bd79e12ef52871ffddc22a76b60f752284f4761354bb1ddfb

Observation 24d7bf2b-47c5-4494-b0a8-a3bbcfec2ef8 · outbound

This paper cites Crispr-gpt: An llm agent for automated design of gene-editing experiments.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Crispr-gpt: An llm agent for automated design of gene-editing experiments

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.786177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.487464Z digest=sha256:c257e892228fb5df639fc04cacfad8b1a5c853c5a48a36b0baaf41e9d4400bb2

Observation ac6f6e28-6b99-4c06-a28e-2d2507c3c7ea · outbound

This paper cites A Survey on Large Language Models for Code Generation.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A Survey on Large Language Models for Code Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.563390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.563390Z digest=sha256:e45f7f803516d59af9541003b5e0bc9acf08d6e769fc045ce3a33860f13ab60a

Observation d6eafb56-a2a7-4cfc-8e9c-54abbfa772b6 · outbound

This paper cites What disease does this patient have? a large-scale open domain question answering dataset from medical exams.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning What disease does this patient have? a large-scale open domain question answering dataset from medical exams

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.645884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.651898Z digest=sha256:fc279f8300983664d131e23df8162bcce584f0f96c09056d904682a07ef7ca5c

Observation f33a9524-a96c-4116-884a-000a202120a4 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.769378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.769378Z digest=sha256:902aa3651a4d0cc4fb5167b86ee9226671ecc94b23c3fe352ecf3fe15c4670a2

Observation 1cdd6523-8ddc-4899-b1e9-b1baf5e61344 · outbound

This paper cites Bioasq-qa: A manually curated corpus for biomedical question answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Bioasq-qa: A manually curated corpus for biomedical question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.500172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:33.839083Z digest=sha256:5fc62a085bbef63471b9a335df4c17f6221939e1e9ce6081d78b9d39eee27976

Observation b7fa524b-9938-4b67-87b6-074d9acbade0 · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Training Language Models to Self-Correct via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.944484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.944484Z digest=sha256:a1426d4ea54e1fff776817f52f5a82e99731d6201dd9ae8ab5f65301c2980ef3

Observation 2b06293d-b9af-4ed1-ae10-8ded4e7c4f18 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.024067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.024067Z digest=sha256:2071b36f2f4533576373166fe12d1bcad3c44e2c7332a94bc3c55c7c44008ff3

Observation 5a98f1ac-515c-4c98-8df5-36f402dc2723 · outbound

This paper cites LAB-Bench: Measuring Capabilities of Language Models for Biology Research.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning LAB-Bench: Measuring Capabilities of Language Models for Biology Research

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.099327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.099327Z digest=sha256:30bf01f27cd3e77f8f026b51be2e8c92a71673215b02bfddb7a63edc0540d44d

Observation 77bbd0b2-17ea-4458-9a67-bf64eef549bc · outbound

This paper cites Biobert: a pre-trained biomedical language representation model for biomedical text mining.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Biobert: a pre-trained biomedical language representation model for biomedical text mining

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.189406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.189406Z digest=sha256:57900bdd85e8699476b321f5ceccb3378ae255153c7d845a3a7ceddff9f6f783

Observation e6a6037e-1978-4a79-95c8-48a164660ba6 · outbound

This paper cites Mapping the Increasing Use of LLMs in Scientific Papers.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Mapping the Increasing Use of LLMs in Scientific Papers

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.285798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.285798Z digest=sha256:b20eef7d4815056f39d3f2d8bd83f2bf5fb11aecdb4ae785c9cb96e4f28df605

Observation 33172ea8-d605-4bde-a5d1-e304650e5cb8 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Understanding R1-Zero-Like Training: A Critical Perspective

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.365003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.365003Z digest=sha256:5adcce64b7aa1d55135142ac022f4b427c38454b232dcdcac9bd2dee1ae38b7a

Observation f8694ac4-f500-4491-96bc-cfff4e84cfcf · outbound

This paper cites Biogpt: generative pre-trained transformer for biomedical text generation and mining.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Biogpt: generative pre-trained transformer for biomedical text generation and mining

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.339770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:34.436232Z digest=sha256:6e411a16ea44cc0ad2ca930097bd5dcb6d5e815cd18e0de929061f71ab63bf32

Observation 61c29d7e-f8ba-48c3-9696-7523461a9b8a · outbound

This paper cites BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.525450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.525450Z digest=sha256:850704d1940d24bc104930a52dcdda39b0fbc0ab0f75c0ce03c0f5e561a65bf7

Observation 6a9d5b13-ca7d-4bd3-86df-09cefabe942b · outbound

This paper cites Covid-qa: A question answering dataset for covid-19.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Covid-qa: A question answering dataset for covid-19

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.178198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:34.619750Z digest=sha256:05165e949a9c42f57df224bd6fb65d07d2d8ec393e3cd08be44dd3d71f95b899

Observation 212554fe-81aa-4ae6-826e-3be54a7976f7 · outbound

This paper cites Training language models to follow instructions with human feedback.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Training language models to follow instructions with human feedback

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.027226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:34.712194Z digest=sha256:d8808e5b91ebef021142892db61d8ac0d4260c6a432cd683a18784987119ef6d

Observation ec343161-45bc-43cb-ba87-66f2b60092bd · outbound

This paper cites Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.770907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.770907Z digest=sha256:fbeba2ec4c80ad4a4abe0c05043968a6ba5ceee34b0c85320f96cadc11a87917

Observation 77d25e6f-a006-435a-be4b-15f8fd6de7a2 · outbound

This paper cites A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:37.871064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:34.829896Z digest=sha256:448f8f8e4646e66e5966ccbecc42ecfcdedf718f1c19dab965b4575274f145e5

Observation 1153b7b9-16d3-4381-8ba0-ecd68bac0d78 · outbound

This paper cites Humanity's Last Exam.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Humanity's Last Exam

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.919303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.919303Z digest=sha256:6f8f2d3b869302ea148a15c71c98750485c76db38ef73806a477cf8b4fb91a1f

Observation c6f1273f-6232-412d-8f21-579df929b853 · outbound

This paper cites SciFive: a text-to-text transformer model for biomedical literature.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciFive: a text-to-text transformer model for biomedical literature

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.015805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.015805Z digest=sha256:cd2fe909dbf69ad0e82abd291307a5ed13b1e179d755a8b8275fb684cdca731d

Observation 398dcbeb-5310-4dbe-bf77-71a92d4be9d6 · outbound

This paper cites OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.092269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.092269Z digest=sha256:c61f419fce00131ae3ca1d344685506e9a825b25f7bce14e3ce319bb44d3cf81

Observation 01f58c65-b194-47b9-bdd7-73f99773a326 · outbound

This paper cites Gpqa: A graduate-level google-proof q&a benchmark.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Gpqa: A graduate-level google-proof q&a benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.171091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.171091Z digest=sha256:8930c5367c0ef5c28446d0ecd17101921b6ef6eae347d385f8ef837ba92839c1

Observation f1dbd3a9-b21d-4d71-ab50-a65683f5700f · outbound

This paper cites Proximal Policy Optimization Algorithms.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.239501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.239501Z digest=sha256:bbe7d4e3a298794e15d1320c498b478d736df5b00ede282ce7af1bc0053129bc

Observation 53a1d2b6-08e4-4829-8fe3-83f970070603 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.320838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.320838Z digest=sha256:b963e1db74ad61c043666b3bf972c93f8a201a842f7ff157062d4a6daee419b6

Observation d0279c49-b79e-457c-9f38-f64049913834 · outbound

This paper cites Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.377873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.377873Z digest=sha256:5624dca0177e2578a31b3f27b0690b54515fe399428fddbd30859f627bacbec5

Observation e2d81dc0-19e9-4631-953a-61b9f0b2d066 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.431025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.431025Z digest=sha256:4c77a7c2223c397517556bbf8a080fdd0e0b3c0a844eeb468828655c2052f18b

Observation 11ccb532-811a-4fa2-a7c2-9f49545af144 · outbound

This paper cites Galactica: A Large Language Model for Science.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Galactica: A Large Language Model for Science

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.497267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.497267Z digest=sha256:c568aa7f689baa3ceacdd716b5a7051f92199fa2bc8cc3b99a0129f735a3f07b

Observation 00e70ae3-52f4-48ff-9b2c-d3a0eb1a415b · outbound

This paper cites A call for built-in biosecurity safeguards for generative ai tools.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A call for built-in biosecurity safeguards for generative ai tools

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.578517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.578517Z digest=sha256:65d0b5684c6d7f9ebeb91e215670537f36d7fca92bcb6a55f085a5491695719d

Observation 5a8f5076-31cb-4081-a8a1-dd64cc10cea3 · outbound

This paper cites Math-shepherd: Verify and reinforce llms step-by-step without human annotations.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Math-shepherd: Verify and reinforce llms step-by-step without human annotations

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.641355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.641355Z digest=sha256:9e52c7bfb4d5069265837cdf569df9bd720f19ac0d50b526e6c9ec72a4e58b7f

Observation 7f645668-9c8f-4882-b23b-0fe5ee70045a · outbound

This paper cites Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.711109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.711109Z digest=sha256:466a396d2fabb95ebe6f60219d3407b8618adfe8be065fb24d1a305be8120c5d

Observation b5447346-bd0c-432b-8df5-a6d32676b0b1 · outbound

This paper cites DARWIN Series: Domain Specific Large Language Models for Natural Science.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DARWIN Series: Domain Specific Large Language Models for Natural Science

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.778875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.778875Z digest=sha256:aaf8dde4e2a70c1f72f7773a87af134987fb17e2add6846adf269c1d18c16c39

Observation bc56ceb1-ca1e-45ab-a9e7-534e7fc3ea92 · outbound

This paper cites A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.860086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.860086Z digest=sha256:28fb92fb648d4caa4a1ad4aba6ef7331e5a6bd05577cd91445d80844db90a17c

Observation bc33c128-912a-46f2-b9d8-2183cc8c76cf · outbound

This paper cites ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.917247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.917247Z digest=sha256:ec376b617dae3964db3bf2c3d654db60be33396f06ae15733e1afb65a4fcdd2b

Observation 092e32ff-81b6-4a4c-b27c-8426ce22c4ec · outbound

This paper cites GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.973838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.973838Z digest=sha256:7f409bf46d91f526e011f7494e0cc838377a9c56272c4da67b9f3a91b5095b22

Observation e54ca4a9-5f34-48a3-bb04-952e8cce4afc · outbound

This paper cites Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.029822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.029822Z digest=sha256:594d58768407533ec327cf82e2edd0a9077b5c2bf422f3eb1bb4833ed0d9be1d

Observation a53ce49d-145b-4e6a-ac43-cc76e727053d · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.086883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.086883Z digest=sha256:9f100bed416a5def72269aec2c3182124e3581a9d19c741b427cd5b6999bc3da

Observation 82e82881-5bed-4ba4-b91c-2b451aba0c5c · outbound

This paper cites BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-08-07T14:16:36.808890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:16:36.154616Z digest=sha256:7085ae623645b62b93b7d6224ea518783455e9775ed499b9264a2155fb63e671

Observation 2c79a4eb-c102-4f33-bc36-b20ffc301b21 · outbound

This paper cites A generalist vision–language foundation model for diverse biomedical tasks.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A generalist vision–language foundation model for diverse biomedical tasks

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.214381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.214381Z digest=sha256:c6f231050b45b83cd5e8a4a77804157e191968e22bc0da0fd0682f690e362f32

Observation f38840b1-f1c2-48c1-a399-4e3266f637bd · outbound

This paper cites Scientific large language models: A survey on biological & chemical domains.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Scientific large language models: A survey on biological & chemical domains

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.302753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.302753Z digest=sha256:4e27e18f0e5032672e0fbbbf17feda6f9f4c68603cb163934c755cb32a423f6f

Observation d3bbb883-9740-4886-bf2b-91166959f7c4 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.509160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.509160Z digest=sha256:bb8dbc25e7c563820b32ba62c6f196a75a25c725b29d01c13d02d83cc7ae21b3

Pith citing papers

Observation e54ca4a9-5f34-48a3-bb04-952e8cce4afc · inbound

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning cites this paper.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.029822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.029822Z digest=sha256:594d58768407533ec327cf82e2edd0a9077b5c2bf422f3eb1bb4833ed0d9be1d

Observation 061e31b1-ba24-4b77-b94f-eef42f8dd929 · inbound

Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need cites this paper.

Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-06T16:17:42.986386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:17:42.986386Z digest=sha256:a12d7136746c41dfa10608d0c5de61358ba95ad73da305d9465af65867a26b75

Observation 836537d0-3232-4b45-9326-727cb0c321c3 · inbound

Evaluating Large Language Models in Scientific Discovery cites this paper.

Evaluating Large Language Models in Scientific Discovery Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-16T21:48:34.403311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-16T21:47:09.588941Z digest=sha256:bd7c256eca1e507df01f59868a207b57404e850806ed61f082fbed4af5f52971

Observation 35dc85c7-1183-4668-ac4d-9ddacfbfa3d3 · inbound

Heterogeneous Scientific Foundation Model Collaboration cites this paper.

Heterogeneous Scientific Foundation Model Collaboration Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-09T04:30:11.969332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-07T08:50:05.980191Z digest=sha256:e9aba9ccc9e0e0bc6a78784112091ebf4976f3ec34d78687cdee1258482ba208

Observation ca5363fa-0429-4cc9-82e4-98d5859b14cb · inbound

How Post-Training Shapes Biological Reasoning Models cites this paper.

How Post-Training Shapes Biological Reasoning Models Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-07-01T07:55:31.065267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-01T07:48:31.110861Z digest=sha256:d0464fd54d74e5278f0b25b2f07b457d11f0a230f3ae048d6cf6f02c980a6022