Pith. sign in

Paper Citation Record · LEDGER

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization

As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2502.07237.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.07237 v1

Coverage vector

measured 88 of 88 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T13:29:10.888735Z

measured 88 of 88 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

88 of 88 outbound references displayed

  • verified exact2
  • verified fuzzy54
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 23139c04-27bb-4f7e-813b-580216ed1d9f · outbound

This paper cites De novo drug design using reinforcement learning with graph-based deep generative models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization De novo drug design using reinforcement learning with graph-based deep generative models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.451377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.451377Z digest=sha256:47817f7c860153dc46e5867e46534034250bb9111edcf194c3372e15729bc551

Observation 9d0e9410-cafb-4473-8484-46ad1e2101fb · outbound

This paper cites DrugCentral 2023 extends human clinical data and integrates veterinary drugs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DrugCentral 2023 extends human clinical data and integrates veterinary drugs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.456789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.456789Z digest=sha256:d3913bd8d361d1a1d1db09a5ec54a7cd3b7378f116e196f704b2421b93fce0f2

Observation 094e99f4-dcb2-4b13-bcd7-7b6683564a28 · outbound

This paper cites MolGPT: Molecular generation using a transformer-decoder model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization MolGPT: Molecular generation using a transformer-decoder model

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.461807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.461807Z digest=sha256:52d74cb83c47726c6cca9907bce3fd0009ca925a330f4fa66b168847c43b8b1c

Observation ccb5f472-fa15-445f-bb50-8fa447178299 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.467246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.467246Z digest=sha256:28ba2f91ed3dd58f19ecab0154de00e38442def1c7bdd7539b0b041ebadff934

Observation 82d291ee-f4ce-4ba9-b9d1-b0baf5213678 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Constitutional AI: Harmlessness from AI Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.472852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.472852Z digest=sha256:3abb477c9d9009527f96beb3a468d93517511293a0497071a28906d60fbd7eaa

Observation 1fb99ddb-7d6c-4982-8791-c187bf18704c · outbound

This paper cites Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.478424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.478424Z digest=sha256:cdca9da089c7911429cdabd54b509177029f3c8f400be52d34ee7c6361c4b7a6

Observation 8cec44a0-b99d-494d-894c-40502357271f · outbound

This paper cites Molecular similarity: a key technique in molecular informatics.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular similarity: a key technique in molecular informatics

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.483408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.483408Z digest=sha256:e7ce2371fee580436d7688894acfb47946e02a0c053ffa16d5c0a8b7c3ae82be

Observation 908a204e-7b65-4486-828e-6f67e9028956 · outbound

This paper cites Better Rewards Yield Better Summaries: Learning to Summarise Without References.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Better Rewards Yield Better Summaries: Learning to Summarise Without References

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.488851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.488851Z digest=sha256:ad432ae03b3e6157ee94f0d8e020f4088e59347ffa6c4229b18884f8f1b3c18c

Observation 36739dfb-d947-46c7-a108-9d1f8d560c50 · outbound

This paper cites Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.493944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.493944Z digest=sha256:ecb118ac6b076d00ef06f31a6d5c5b71668d46b9d4e4af905a8770d034a2d890

Observation 0a097645-0b34-49a0-99ab-973421e42fee · outbound

This paper cites Transformers and Large Language Models for Chemistry and Drug Discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformers and Large Language Models for Chemistry and Drug Discovery

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.423383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.498827Z digest=sha256:41589545c5fa153b7b77ebaf1b762559ecf38e47682ccadbc35e38db41cff5b7

Observation 6a5f96de-cb61-450e-bbcb-094a52ef9aaf · outbound

This paper cites Offline rl without off-policy evaluation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Offline rl without off-policy evaluation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.504287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.504287Z digest=sha256:8bee61c23b54493c74646514989973125afd745add29787fd235f14bca18e2b6

Observation f5663653-79bf-4e7d-83ff-f771d6600718 · outbound

This paper cites Safe learning in robotics: From learning-based control to safe reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Safe learning in robotics: From learning-based control to safe reinforcement learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.509689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.509689Z digest=sha256:6d75c982dd5d4957eee0fd71c08a446ffcaf5f761ec5e4de41ec5bcaa2db612a

Observation b206893b-d305-46af-9ba2-a6d27ec1fd6e · outbound

This paper cites Policy improvement via imitation of multiple oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy improvement via imitation of multiple oracles

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.326377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.514629Z digest=sha256:8e86f3229591df7e7488d7e1508b6ec59c2a31151c01efec06fd3d5c7e9299a9

Observation ffe4e10b-1f35-416f-9024-d5175ba07ca6 · outbound

This paper cites Deep reinforcement learning from human preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning from human preferences

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.310763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.519703Z digest=sha256:43e00a177cbd8b54c69670ccee3254c3532205a0c38a51b78398aecdc22f3457

Observation 6d6b85ae-ff03-40d4-8545-30fe36030596 · outbound

This paper cites Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.295680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.524690Z digest=sha256:4279266bde899897e9f78081ed81d9d9ffabf2e4a7929a452c18b9cb77347a7d

Observation f8011063-e22b-4fe0-b4c1-f863cc232dce · outbound

This paper cites The cost of new drug discovery and development.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The cost of new drug discovery and development

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.280350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.529941Z digest=sha256:1867aba51c3b6187b819529aa304d1d2826eb5492c116328ed0dee4c0f71f9a9

Observation 6408ef31-5451-4b82-9dd6-5bc38750038f · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.536482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.536482Z digest=sha256:74ef541fb8cde93c9265ac0ab6a714266008b2ffd9e6af851eb39c1b9f3f37da

Observation dbbe1424-7a55-4100-9f5e-7cd3bad2a6dc · outbound

This paper cites Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.264876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.541731Z digest=sha256:1d1f31c4b428cbedde263178fbdb7b92fcf75e03d0f8f79cb8ceeae3625223cb

Observation e225d3ef-bfcd-48bb-a2cc-4e3f05adb878 · outbound

This paper cites Neural scaling of deep chemical models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural scaling of deep chemical models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.249858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.546660Z digest=sha256:de84a89de45329950eb903361ccf2cdf297fc4b8941a81837492147a0d8c31a8

Observation 99205759-fa1f-4eba-8e4d-fd3042074733 · outbound

This paper cites Mimosa: Multi-constraint molecule sampling for molecule optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Mimosa: Multi-constraint molecule sampling for molecule optimization

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.234419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.551668Z digest=sha256:a1eb72ddb76f7cb751fcc4268bdca80c7fd1280ee656a2b0ae2307642a594038

Observation 4a7f36a5-e36b-4f42-b179-3ffa4f7b6085 · outbound

This paper cites A new algorithm for data compression.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A new algorithm for data compression

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.218993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.556435Z digest=sha256:67fc7c4ef84cde39f742d8b22ea593997b38ba89b2b52d92199a9e4fefeca635

Observation b376e5c0-8b05-4431-ad25-18d3f51c0417 · outbound

This paper cites Scaling laws for reward model overoptimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scaling laws for reward model overoptimization

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.203370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.561585Z digest=sha256:1476da0c970c9bbe8e3c75512b713a01b89ae86a06b00ff2b4beb14244b17726

Observation e21d29d2-23bd-4f8d-906e-1ae1ef185db7 · outbound

This paper cites Learning to navigate the synthetically accessible chemical space using reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to navigate the synthetically accessible chemical space using reinforcement learning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.187597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.566706Z digest=sha256:f271972779014d364b134dba735482fa13d3a83c7387a3ac13aba8506dbb0d9c

Observation d32b5402-a510-45ef-b87b-616781316bb6 · outbound

This paper cites Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.571560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.571560Z digest=sha256:6ddcd5a2fcfc32b1c6f46e1a7641b99c3bb5325819a29a9997f42d150679f7bc

Observation b7304e96-c6e4-4c95-91ca-e36e862cec1b · outbound

This paper cites Covid-19 vaccines and variants of concern: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 vaccines and variants of concern: A review

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.172238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.576746Z digest=sha256:8bd0e57bbbc62a0ead89feeec35bde25f4f47499d3fd8abecdeb4bd59e14f10e

Observation 0e52c434-b836-469b-ab68-9ec432686a76 · outbound

This paper cites Learning from Dialogue after Deployment: Feed Yourself, Chatbot!.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning from Dialogue after Deployment: Feed Yourself, Chatbot!

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.581537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.581537Z digest=sha256:3323c24013efbc9e377558aeda7996e32ad2c5509cb20ef6ec11a96813166529

Observation 114d79ca-e711-4826-a1ba-021da26e1722 · outbound

This paper cites Molecular optimization by capturing chemist’s intuition using deep neural networks.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular optimization by capturing chemist’s intuition using deep neural networks

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.156432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.587407Z digest=sha256:510e093809a799f0a27a045a5d1a320b7fcba1f4b8bf11bafa608f4a852df33f

Observation dde8d5c8-2416-45be-b872-05cb4270c05b · outbound

This paper cites Transformer-based molecular optimization beyond matched molecular pairs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformer-based molecular optimization beyond matched molecular pairs

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.141145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.592697Z digest=sha256:0f375858f50cdbce83dc727bd54165f8129e43d6e44be7a5cf8c5617f47a5398

Observation 5c1a2ea6-fde2-4a2b-9334-ec8c4e6932d3 · outbound

This paper cites Reward learning from human preferences and demonstrations in atari.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reward learning from human preferences and demonstrations in atari

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.126101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.597480Z digest=sha256:3959b4d3955d9bb12239db0a407810ededb5ed8d73b85cce55ca244f6838badc

Observation ae7472bf-2b7d-46c6-8e9a-b17704c9eefa · outbound

This paper cites The distribution of the flora in the alpine zone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The distribution of the flora in the alpine zone

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.111431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.601947Z digest=sha256:9a1d25302e80f965418d28b3f317bb439e0a9d1c34abc3bf417b00d26a3a55dc

Observation aa297f5a-ade7-4a7d-b120-6cebc83fd29e · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.606901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.606901Z digest=sha256:a5deda233786ce72c5b70ffdb97675e7b3ccac4ae5a556cd49572c7f991ed3bc

Observation fece7bd0-12ae-4d39-b813-073e94735335 · outbound

This paper cites A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.096586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.612042Z digest=sha256:87551a90199a21393fdcfc9e9ca3b635e369ee6c6b01342c1d2054889f39733f

Observation 9d3aabbc-ec55-47f2-a8b1-249e90dd010c · outbound

This paper cites Multi-objective molecule generation using interpretable substructures.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Multi-objective molecule generation using interpretable substructures

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.081061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.616638Z digest=sha256:f51c93155218931c6557616ab3fc3c6beb6115e1feabf4c210fd699c54ded79c

Observation cb0cd3ed-101b-4b17-afec-2b76042e4c5b · outbound

This paper cites Posit: flexible shape-guided docking for pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Posit: flexible shape-guided docking for pose prediction

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.065686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.621388Z digest=sha256:dd449b0ee1886692e0e7907b2b143dd14357f948499c6c2b4e5d97671a1b94f5

Observation a001709c-5cf6-4e19-b714-4d43d8d6c97e · outbound

This paper cites Giraffe: Using Deep Reinforcement Learning to Play Chess.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Giraffe: Using Deep Reinforcement Learning to Play Chess

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.626000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.626000Z digest=sha256:edf1c7a76b01d534f4f5766168298b2f09692f41e70cfef5533d73d7852b9abf

Observation c7eed6fe-8191-457f-afc1-e099f4c25882 · outbound

This paper cites RDkit: Open-source cheminformatics software.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RDkit: Open-source cheminformatics software

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.050462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.631332Z digest=sha256:d8043548b3b5574a59774a39068a6bd0cc202c8284f1dc67e7c7d1274f9fb855

Observation 7a663836-d1df-4baa-96fd-3b8c2d7ed932 · outbound

This paper cites Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.034338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.635987Z digest=sha256:61ac156fcbe916494cd929e4cc8ed9e00de167c90103e3873e96ca1e67a95cea

Observation f8dccded-8c51-48f6-b699-731479c7493b · outbound

This paper cites Scalable agent alignment via reward modeling: a research direction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scalable agent alignment via reward modeling: a research direction

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.640998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.640998Z digest=sha256:9ba987f0a3d1a93683236bd63c1d8ea8b193eed14a869ae0fdf774046412ecf4

Observation 1a7dd7a7-bef0-403e-a139-deb71922ae6e · outbound

This paper cites Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.018940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.646464Z digest=sha256:fe4a20f5864e2a3c7b4ba83844a03b78427c823eef318ea0b2ad0c6fc8675dea

Observation 45814632-f5bc-4067-a44e-6ebf4a9eda45 · outbound

This paper cites Blending Imitation and Reinforcement Learning for Robust Policy Improvement.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Blending Imitation and Reinforcement Learning for Robust Policy Improvement

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.651020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.651020Z digest=sha256:49e188adca2edfdf5168ff9d427b92c532116d4b853d0fd9609a8f0bcb52f602

Observation d68f1ad5-5c2d-4a3e-9463-91497975427c · outbound

This paper cites Active policy improvement from multiple black-box oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Active policy improvement from multiple black-box oracles

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.002550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.655982Z digest=sha256:8963a53a6b4c65f2d770e2683656e409813f8006924341bd30ef035c04062674

Observation cbe878d8-589b-4a63-930d-8bb6f217e96f · outbound

This paper cites Entropy-reinforced planning with large language models for de novo drug discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Entropy-reinforced planning with large language models for de novo drug discovery

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.987215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.660687Z digest=sha256:6f6ddc69ffaeaa7d91bf380815d5f0255f769b7e7005fe831eae09f675723a51

Observation abe3419c-4ce9-4b80-b31d-9602a5d27bf9 · outbound

This paper cites Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.972163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.665499Z digest=sha256:1f03607286313beb4537afc72a18f73c3eb6a5df7e158b00e6c6daa882b29ac6

Observation f23e3ed9-0fd9-432a-96a1-000f1f2be132 · outbound

This paper cites Reinvent 4: Modern ai–driven generative molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinvent 4: Modern ai–driven generative molecule design

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.956432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.670541Z digest=sha256:27585f2bb41f036dce65caf65882c7d6042412f232b087c31a634f4437797d51

Observation 92dd2be8-1865-48ae-946d-fe2f337ae38d · outbound

This paper cites The different mechanisms of cancer drug resistance: a brief review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The different mechanisms of cancer drug resistance: a brief review

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.941167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.675183Z digest=sha256:99b814412b18e86d263f209c92d2659a6cd886a4a6bbcf703aa3d0eb16404463

Observation e480c6e2-d2ed-4c25-b705-2a498bc9e1ba · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Playing Atari with Deep Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.679677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.679677Z digest=sha256:bcf6adbf8d79012aca3059e6dc12c3689823430a5ce4c664b91dba81f450dc07

Observation 338e75be-78b2-4fd9-b61d-457709dea35e · outbound

This paper cites Exploring deep recurrent models with reinforcement learning for molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Exploring deep recurrent models with reinforcement learning for molecule design

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.926339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.684720Z digest=sha256:b078bfd292334c6f61bf464a9c179fcd928787a5a7f3aea13c9e8faf8f48b848

Observation b4507f40-8c05-4b63-893c-b8f11b8e39df · outbound

This paper cites Molecular de-novo design through deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular de-novo design through deep reinforcement learning

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.911596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.689475Z digest=sha256:74fb4976d780dd28dabaf32cacdb810efe6fe42fc994c6f2d7ac82eba05539d3

Observation 63ed8f5a-6c28-4931-880e-9b09de5fc5cb · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.694293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.694293Z digest=sha256:cb24853b758a726261aa51a3d9a45350364c796cf592fbea13fac783c7f0ec31

Observation 05bb62f3-110c-4816-afd9-60a17d77301a · outbound

This paper cites Combinatorial enumeration of groups, graphs, and chemical compounds.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Combinatorial enumeration of groups, graphs, and chemical compounds

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.897575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.699598Z digest=sha256:d4b53b6bae9d01a9ab95dc039833b58ed481c3fc5af868c4a0961ae06e470e24

Observation 324daebc-83d2-460e-9377-5d455a92e951 · outbound

This paper cites Alvinn: An autonomous land vehicle in a neural network.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Alvinn: An autonomous land vehicle in a neural network

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.883398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.704511Z digest=sha256:b5576bebb89a4a213fc2c5091a72eeb9c47a31ba679cf8c14bbd7ae344c52eb8

Observation 04c6d37d-e073-472f-8d33-a72063f62fd4 · outbound

This paper cites Deep reinforcement learning for de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for de novo drug design

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.868339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.709787Z digest=sha256:55be9d89ed02815545e8ab902c280a4e46f484d0351ded9527cc0fb4ae449bb2

Observation 6360c346-a16e-4542-b7ff-68aeffca25f5 · outbound

This paper cites Drug repurposing: Progress, challenges and recommendations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drug repurposing: Progress, challenges and recommendations

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.853447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.714625Z digest=sha256:45e2da6bab05db3e93dc7c88cf1a8b9544779c4f7a98f3c955281131b1a5b85d

Observation 82924bfc-aaeb-4363-9c18-367187623f97 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.719469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.719469Z digest=sha256:c0763f656714debb51acbfc46c36533aa9c978d1af25f96b146e6e91ac06e9ac

Observation e6274477-7f12-4eb8-8b7f-b78cc1b06e12 · outbound

This paper cites Learning by playing solving sparse reward tasks from scratch.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning by playing solving sparse reward tasks from scratch

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.838474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.724522Z digest=sha256:d24327b6e27d8273a0a8d3684c13b963482637f655868079cde01a7339daad08

Observation 9cf7afa3-b90c-453f-9ab1-185431ee459f · outbound

This paper cites Extended-connectivity fingerprints.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Extended-connectivity fingerprints

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.822920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.728977Z digest=sha256:9ddca7e5327a226e988b05091cb5be9b3c1889f251dc001b4869152ce89b32a6

Observation 923c1ada-3d19-43c8-bf55-60a20962d984 · outbound

This paper cites Reinforcement and Imitation Learning via Interactive No-Regret Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement and Imitation Learning via Interactive No-Regret Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.733657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.733657Z digest=sha256:2e412238a895a2d87a506580d55f5350597a579b8cf1cef4998a92c1bca4b368

Observation 0f3302b8-5f07-40e5-a7e3-74df4faaa6cd · outbound

This paper cites A reduction of imitation learning and structured prediction to no-regret online learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reduction of imitation learning and structured prediction to no-regret online learning

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.807028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.738675Z digest=sha256:6125541d55a96b3f9bef675d4d8839c8a4239f4da73ae318090050170e2780ba

Observation 08c26f04-fe45-446c-bb7e-c8d7bbe3b902 · outbound

This paper cites C5T5: Controllable Generation of Organic Molecules with Transformers.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization C5T5: Controllable Generation of Organic Molecules with Transformers

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.090606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.743339Z digest=sha256:bf7f48caffdee18bcc4c876ea6353bd151444454b6f5755ce445c0eda908a5ec

Observation e17aae1f-ad39-4e19-ad42-6afc84602047 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural Machine Translation of Rare Words with Subword Units

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.748664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.748664Z digest=sha256:92cb624f43cd8f36b26729d4f522cc12021258e0318aff2bbfb06fde863950ca

Observation 5178c9a0-2e29-46b7-b83a-c5196241925f · outbound

This paper cites Preference Ranking Optimization for Human Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Preference Ranking Optimization for Human Alignment

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.753720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.753720Z digest=sha256:4dfd63fb4ae1c1d61caa6d107fcc3db7ce66e39e51e4e06bb77157e45bd49e16

Observation 10823088-7042-4c39-b78c-4c9fde3ca91f · outbound

This paper cites Deep reinforcement learning for multiparameter optimization in de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for multiparameter optimization in de novo drug design

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.790337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.758864Z digest=sha256:69b85ec11ba365ef8ad375d9a039fa2b56e16733c8942794304f773ddacd2124

Observation 37ee144e-2f30-4b2f-b5af-21356c0f20be · outbound

This paper cites ZINC15–ligand discovery for everyone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization ZINC15–ligand discovery for everyone

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.774076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.763559Z digest=sha256:15cc312631afb951ef939b8611e31c5d5c597f667d1de027e19847d7fda4d04a

Observation 44a38208-e0ec-4566-a5d4-4d44c5fc3455 · outbound

This paper cites Learning to summarize with human feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to summarize with human feedback

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.758229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.768526Z digest=sha256:85b6c11d6ccdd0af0838caa6e81bfa15d0291454708e15e78785ab95517b8fdc

Observation 15067d09-f0c6-4d66-9de7-7883d3521f85 · outbound

This paper cites Molsearch: search-based multi-objective molecular generation and property optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molsearch: search-based multi-objective molecular generation and property optimization

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.742320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.773329Z digest=sha256:1b4b9ec7a47af9075476e04b3e705fa367a94dc0e25be7f78950e679275ba034

Observation 469feec5-13f5-47f2-8e77-8d19c8129579 · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy gradient meth- ods for reinforcement learning with function approximation

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.726293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.778406Z digest=sha256:d524960391f506e46f2b65c1836f666c5cc1c9fd2b1c2437b083507d700ef3ed

Observation d3e42ab1-d33a-4709-affb-8a0690452915 · outbound

This paper cites Reinforcement learning for systems pharmacology-oriented and personalized drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement learning for systems pharmacology-oriented and personalized drug design

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.711259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.783054Z digest=sha256:3ae5f17b1133a4ff14bb2dea6b276546f20cf4ab26f354b1dec8256c67ec6766

Observation 202f7111-55b2-412c-a7ae-549f1931acfe · outbound

This paper cites Drlinker: Deep reinforcement learning for optimization in fragment linking design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drlinker: Deep reinforcement learning for optimization in fragment linking design

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.694766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.788037Z digest=sha256:eb1c08821e6c9cc9615a827786405753f84a1296d16e6b378d4efc9159eeb6d8

Observation e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc · outbound

This paper cites DeepMind Control Suite.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DeepMind Control Suite

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.793596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.793596Z digest=sha256:73385f6421b51bafe46fcdcbf369b1fb98b8ce438ca9c719984c4d5cd9b6912a

Observation 40b71e8d-b632-4ee5-9a72-464d617a31a7 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.799215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.799215Z digest=sha256:e29f6f09ab100b46dd21f2fde71ce82d6532346ae0568b14fa546d0e7a5a12e6

Observation fec0ce4c-f3bf-4c3c-a04a-ce7dfaaf87a0 · outbound

This paper cites Matched molecular pair analysis in short: algorithms, applications and limitations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Matched molecular pair analysis in short: algorithms, applications and limitations

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.678824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.804399Z digest=sha256:faa92b73fb9580c052c86297e078f9225b66081557027cedb7246d416bf77421

Observation 9a8ed734-2a4a-471a-84c4-28b01a56a7cc · outbound

This paper cites Benchmarking language-based docking models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Benchmarking language-based docking models

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.662679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.809172Z digest=sha256:9eb7c6a86d5bb9fa228e41ece89abde336b486b7c876a2d36e4991bffe49e246

Observation 8bf24568-87e4-47ae-9c4b-bf637c89ade6 · outbound

This paper cites Attention is all you need.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Attention is all you need

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.813976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.813976Z digest=sha256:6db1b1ded30be7a01321aa9b5ef2cfadbe4908c9252faa06a2d1afe596f80dbc

Observation 52f6e24d-3e2b-4499-baeb-dc4bc2aab748 · outbound

This paper cites Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.818690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.818690Z digest=sha256:06c69dc70bc4743210bbaef9a2635c556a7a3d4ef952dffa0fa6068151de01df

Observation edcf64a5-0810-4c24-a6e8-afa7a4f859d0 · outbound

This paper cites A reinforcement learning approach for protein–ligand binding pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reinforcement learning approach for protein–ligand binding pose prediction

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.635880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.823746Z digest=sha256:3fa50b822aae230faf82d3f52e4c2896348a854aa846471be00be6a8e3572c5e

Observation f994b61a-7269-49dd-8090-b8f1ec351a08 · outbound

This paper cites Smiles, a chemical language and information system.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Smiles, a chemical language and information system

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.619981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.829086Z digest=sha256:0272234e7fee148a7ee07b12a047eadc2a1c830abdf96c4f6683f5e4a0956cb8

Observation 8b7c7211-8225-4e6a-b98a-6183fba0b0d5 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.604580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.833793Z digest=sha256:b1c7545228bc9d1a45447e48436195a6f2b0f2b19b7cd056694b5d7e33ee8a34

Observation 58fa5c6a-c918-4eaa-9ef0-b8dc150444d3 · outbound

This paper cites Recursively Summarizing Books with Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Recursively Summarizing Books with Human Feedback

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.838714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.838714Z digest=sha256:df8cea8bca0f59019e49dc6742584e8b5bcf80386d10417839d2f76e6e3d35ef

Observation af742400-5b96-4b63-823e-c8c6b4b59aca · outbound

This paper cites Rlcg: When reinforce- ment learning meets coarse graining.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rlcg: When reinforce- ment learning meets coarse graining

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.588909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.844060Z digest=sha256:c6a2b67f784fc28213c8bfa1c725ce6a06042dd852beabec1e004ebcb06257b5

Observation dba36a93-4910-49b2-9b99-285bbd402e00 · outbound

This paper cites Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.848704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.848704Z digest=sha256:b9af566433765c65378c9cbce0cd012a785b9790c5db2e06f9b31f0bbabacd85

Observation a1231f94-5d75-4426-8925-59a0c3e6d2bc · outbound

This paper cites Population-based de novo molecule generation, using grammatical evolution.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Population-based de novo molecule generation, using grammatical evolution

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.572547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.854230Z digest=sha256:bcbfb5d763190b7f5c6735caa6e7fc5c0413ba06a9ec58395b042cf88ed95e14

Observation 45f5e9b4-6aea-412f-9781-7ea6f37df6f9 · outbound

This paper cites Graph convolutional policy network for goal-directed molecular graph generation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Graph convolutional policy network for goal-directed molecular graph generation

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.555221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.858943Z digest=sha256:ef3fd2f8b88cf95a7b67d38160b96045e88f3ac78dd09d08560a01da1325a9b6

Observation 3ebf7b5d-0ca2-4611-99a3-a929bb3607b9 · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.539385Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.863986Z digest=sha256:128a934f034f0b49415286508d7f27edbc7f1a117abdb870137f950e4873fc40

Observation 0959e6bb-b69f-4519-b139-d1afefd35b8d · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.869139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.869139Z digest=sha256:f9cd707f0a9a764fb6386368631e89a7459f7b0ac5a023fc31f83652d25783de

Observation 910f057e-941d-4419-be53-bfbc0764eb8d · outbound

This paper cites Covid-19 pathophysiology: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 pathophysiology: A review

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.523296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.874390Z digest=sha256:6aa7d4823738cb5688e458fca1ae54e1689d4604a85344b60e3671aa8ecd92ed

Observation 3e9b7808-5ea1-409d-92de-313d0a645cb9 · outbound

This paper cites Universal approach to de novo drug design for target proteins using deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Universal approach to de novo drug design for target proteins using deep reinforcement learning

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.508183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.879206Z digest=sha256:c0497299aeb86dd7394cc4960eb0d73efa71819e87b3995a9f8b06193e75c66c

Observation eef72f93-4f95-40c2-8916-4eb13c4799fc · outbound

This paper cites Optimization of molecules via deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Optimization of molecules via deep reinforcement learning

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.491284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T13:29:10.884009Z digest=sha256:bf3cfe00385b7df9c66093299f2980e38c9d369d35749286cd256a08b061b073

Observation b5fe6846-2656-4838-8bc3-70065bc8adff · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Fine-Tuning Language Models from Human Preferences

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.888735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.888735Z digest=sha256:7b70e2279ff3cacbc3a06d474d75ee8cda816bc4738953bcafce19ee476ec75d

Pith citing papers

No inbound Pith citation observations are available.