Pith. sign in

Paper Citation Record · LEDGER

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization

As of 10 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2502.07237.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.07237 v1

Coverage vector

measured 88 of 88 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T13:29:10.888735Z

measured 88 of 88 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

88 of 88 outbound references displayed

  • verified exact2
  • verified fuzzy54
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 23139c04-27bb-4f7e-813b-580216ed1d9f · outbound

This paper cites De novo drug design using reinforcement learning with graph-based deep generative models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization De novo drug design using reinforcement learning with graph-based deep generative models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.451377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.451377Z digest=sha256:b40fcdf9061d43b80770cbfde0333a4325a566f6fb5ded6baf8c5f5b4aa1cccd

Observation 9d0e9410-cafb-4473-8484-46ad1e2101fb · outbound

This paper cites DrugCentral 2023 extends human clinical data and integrates veterinary drugs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DrugCentral 2023 extends human clinical data and integrates veterinary drugs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.456789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.456789Z digest=sha256:f1acbfad582a3c449cd29e1edd8a968068d19a74ff7b893c9425488fc036ffa2

Observation 094e99f4-dcb2-4b13-bcd7-7b6683564a28 · outbound

This paper cites MolGPT: Molecular generation using a transformer-decoder model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization MolGPT: Molecular generation using a transformer-decoder model

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.461807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.461807Z digest=sha256:31919a918dbe5ccbdd42303a5178363de6022b118d396e1500392e5a5c9e6b82

Observation ccb5f472-fa15-445f-bb50-8fa447178299 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.467246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.467246Z digest=sha256:08a34d401ee14f671678137745a3d9c408f7e82a5cb59cad1f30114f4ae287cc

Observation 82d291ee-f4ce-4ba9-b9d1-b0baf5213678 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Constitutional AI: Harmlessness from AI Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.472852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.472852Z digest=sha256:8b2714e67d688c25774e7a25760bf02400db694117aeceeb3e9ac908b13c397c

Observation 1fb99ddb-7d6c-4982-8791-c187bf18704c · outbound

This paper cites Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.478424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.478424Z digest=sha256:092875793e9252a8f093b5665c9658825526afea51b29338de1c26f1597214de

Observation 8cec44a0-b99d-494d-894c-40502357271f · outbound

This paper cites Molecular similarity: a key technique in molecular informatics.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular similarity: a key technique in molecular informatics

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.483408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.483408Z digest=sha256:da4fe278da25eec98683e50210b69f9c0f80b96f78690b0fe450e76105734864

Observation 908a204e-7b65-4486-828e-6f67e9028956 · outbound

This paper cites Better Rewards Yield Better Summaries: Learning to Summarise Without References.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Better Rewards Yield Better Summaries: Learning to Summarise Without References

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.488851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.488851Z digest=sha256:21669497e9783704448e7ebf4fb9accac8984e0b0719a042d648794eaf325aa6

Observation 36739dfb-d947-46c7-a108-9d1f8d560c50 · outbound

This paper cites Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.493944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.493944Z digest=sha256:fdb40e4ee67489c8ccbe5e3f144b733567dc8a18482b4b49c2155c2f16bdbef8

Observation 0a097645-0b34-49a0-99ab-973421e42fee · outbound

This paper cites Transformers and Large Language Models for Chemistry and Drug Discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformers and Large Language Models for Chemistry and Drug Discovery

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.423383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.498827Z digest=sha256:6c6ffdeb9fac4cc7d6cd0ecee652a13ce5a37d72429ac987aa92f3a6d1ca5fd5

Observation 6a5f96de-cb61-450e-bbcb-094a52ef9aaf · outbound

This paper cites Offline rl without off-policy evaluation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Offline rl without off-policy evaluation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.504287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.504287Z digest=sha256:1c086cc84e0c7dee01a308f82c2681da679f667a82cb93dff4ceeadee3731c24

Observation f5663653-79bf-4e7d-83ff-f771d6600718 · outbound

This paper cites Safe learning in robotics: From learning-based control to safe reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Safe learning in robotics: From learning-based control to safe reinforcement learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.509689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.509689Z digest=sha256:87e69e3b8227e65d4173f922a758aa1c75746b91ae3f490cdc5ec77e336f76e4

Observation b206893b-d305-46af-9ba2-a6d27ec1fd6e · outbound

This paper cites Policy improvement via imitation of multiple oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy improvement via imitation of multiple oracles

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.326377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.514629Z digest=sha256:ea022e78a0d201ae1d6f301523bec352c4b54337769da0c7dcc7fafa6dc703b8

Observation ffe4e10b-1f35-416f-9024-d5175ba07ca6 · outbound

This paper cites Deep reinforcement learning from human preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning from human preferences

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.310763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.519703Z digest=sha256:83384b37cdbd82bb2a2a2fba777bd214372a90ac9719e7b3bdc1ee9c73921c91

Observation 6d6b85ae-ff03-40d4-8545-30fe36030596 · outbound

This paper cites Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.295680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.524690Z digest=sha256:64b525e55ce9f4b22e850b9c824e5d9ce8f8e925ec3261813fb54069bb9a0164

Observation f8011063-e22b-4fe0-b4c1-f863cc232dce · outbound

This paper cites The cost of new drug discovery and development.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The cost of new drug discovery and development

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.280350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.529941Z digest=sha256:f1ed0ac707f223c1c0ecb58f343a6e66c7b317fb231c3d956594148abe7f4976

Observation 6408ef31-5451-4b82-9dd6-5bc38750038f · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.536482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.536482Z digest=sha256:921cd072da34f194cecdd6c68be89c5b30e581479bb6cf1ad636b5e765ca8916

Observation dbbe1424-7a55-4100-9f5e-7cd3bad2a6dc · outbound

This paper cites Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.264876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.541731Z digest=sha256:9b37cf02c8aa43d0d61b41e567a3ae7b4324a8ade18a176a34c268cab12182fd

Observation e225d3ef-bfcd-48bb-a2cc-4e3f05adb878 · outbound

This paper cites Neural scaling of deep chemical models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural scaling of deep chemical models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.249858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.546660Z digest=sha256:557e122885ff25c657eb3e2b415ac20aed48b6de3d0b59fea32a2008e0137a59

Observation 99205759-fa1f-4eba-8e4d-fd3042074733 · outbound

This paper cites Mimosa: Multi-constraint molecule sampling for molecule optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Mimosa: Multi-constraint molecule sampling for molecule optimization

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.234419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.551668Z digest=sha256:b6e3e7b62843fcbfee5765205cbf67f24b71ca926633f63945a9222e36d772af

Observation 4a7f36a5-e36b-4f42-b179-3ffa4f7b6085 · outbound

This paper cites A new algorithm for data compression.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A new algorithm for data compression

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.218993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.556435Z digest=sha256:196011fbc135ca57752256cb52a9f4b47610695e0fb6920267d3c3b1f380dd26

Observation b376e5c0-8b05-4431-ad25-18d3f51c0417 · outbound

This paper cites Scaling laws for reward model overoptimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scaling laws for reward model overoptimization

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.203370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.561585Z digest=sha256:8e9b961ec4df719b2737f292e02e1255144467e4f45709ad881f8547eb012434

Observation e21d29d2-23bd-4f8d-906e-1ae1ef185db7 · outbound

This paper cites Learning to navigate the synthetically accessible chemical space using reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to navigate the synthetically accessible chemical space using reinforcement learning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.187597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.566706Z digest=sha256:53fc2956f1a85a30cb383ade35fdeda58689615d1ce241d8426b55ca8e0698b2

Observation d32b5402-a510-45ef-b87b-616781316bb6 · outbound

This paper cites Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.571560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.571560Z digest=sha256:e34669f71cad75a31ca2376074de3693cefd931709e38c21ab5fa09ee83c30d4

Observation b7304e96-c6e4-4c95-91ca-e36e862cec1b · outbound

This paper cites Covid-19 vaccines and variants of concern: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 vaccines and variants of concern: A review

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.172238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.576746Z digest=sha256:0ba03ddf97d6e5043e13d076271e39b93447fcb7e16643a5794e6ffdd3b229a8

Observation 0e52c434-b836-469b-ab68-9ec432686a76 · outbound

This paper cites Learning from Dialogue after Deployment: Feed Yourself, Chatbot!.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning from Dialogue after Deployment: Feed Yourself, Chatbot!

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.581537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.581537Z digest=sha256:58a839d4bd3ce37f29b4e66bdb678b9e2189840b7715d49f0a57a47fce37bb1a

Observation 114d79ca-e711-4826-a1ba-021da26e1722 · outbound

This paper cites Molecular optimization by capturing chemist’s intuition using deep neural networks.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular optimization by capturing chemist’s intuition using deep neural networks

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.156432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.587407Z digest=sha256:67137d186659453d0d4b0517601f3395a3c676df666ce520db8b9ab0dfaff42e

Observation dde8d5c8-2416-45be-b872-05cb4270c05b · outbound

This paper cites Transformer-based molecular optimization beyond matched molecular pairs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformer-based molecular optimization beyond matched molecular pairs

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.141145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.592697Z digest=sha256:1e1939ca7a6779d1d98321bf43160105fbedb3339d9d7467b8438fa2354fd502

Observation 5c1a2ea6-fde2-4a2b-9334-ec8c4e6932d3 · outbound

This paper cites Reward learning from human preferences and demonstrations in atari.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reward learning from human preferences and demonstrations in atari

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.126101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.597480Z digest=sha256:b068936974efdb1c2e668030559330d0f48e06318accc091e703c738be5891eb

Observation ae7472bf-2b7d-46c6-8e9a-b17704c9eefa · outbound

This paper cites The distribution of the flora in the alpine zone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The distribution of the flora in the alpine zone

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.111431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.601947Z digest=sha256:4b660994cc977a0ed48b6c365bc888c1894f0f09524bf2226b33ab4307fd936f

Observation aa297f5a-ade7-4a7d-b120-6cebc83fd29e · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.606901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.606901Z digest=sha256:d09095ba873fc6e2dfd3605fa052d352cfad0fd39b0959fd5d668e5b166d5179

Observation fece7bd0-12ae-4d39-b813-073e94735335 · outbound

This paper cites A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.096586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.612042Z digest=sha256:a7f472c794a04ad65c0f759a32bd0148e98f131d89a6b8b269352d20fee0e5d6

Observation 9d3aabbc-ec55-47f2-a8b1-249e90dd010c · outbound

This paper cites Multi-objective molecule generation using interpretable substructures.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Multi-objective molecule generation using interpretable substructures

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.081061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.616638Z digest=sha256:6f3383acf9c1d964a40502e5feb1107e8ecefb8aafdf80f853331ab77f1bff2b

Observation cb0cd3ed-101b-4b17-afec-2b76042e4c5b · outbound

This paper cites Posit: flexible shape-guided docking for pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Posit: flexible shape-guided docking for pose prediction

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.065686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.621388Z digest=sha256:4199f86e1b558dc7a08a456409e8e0a15d9f8ae9165918c7ad55dde66276a05e

Observation a001709c-5cf6-4e19-b714-4d43d8d6c97e · outbound

This paper cites Giraffe: Using Deep Reinforcement Learning to Play Chess.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Giraffe: Using Deep Reinforcement Learning to Play Chess

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.626000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.626000Z digest=sha256:f684a4f8d3152705b74df3dbbf7adfa90e164ba7d75cd71350833a99595f162f

Observation c7eed6fe-8191-457f-afc1-e099f4c25882 · outbound

This paper cites RDkit: Open-source cheminformatics software.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RDkit: Open-source cheminformatics software

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.050462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.631332Z digest=sha256:8a9545e8dd90c97427b083c88df15cbaae70a202504747b7e1fe5f090054863e

Observation 7a663836-d1df-4baa-96fd-3b8c2d7ed932 · outbound

This paper cites Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.034338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.635987Z digest=sha256:10c8a826a3cc1cd1296982dca6e0d9724e0f07393649391623d13f7b3df9f53a

Observation f8dccded-8c51-48f6-b699-731479c7493b · outbound

This paper cites Scalable agent alignment via reward modeling: a research direction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scalable agent alignment via reward modeling: a research direction

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.640998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.640998Z digest=sha256:b99ab4fd46099fb01cd0c33daa860e5427169e74add0a68ebc5a349339a16194

Observation 1a7dd7a7-bef0-403e-a139-deb71922ae6e · outbound

This paper cites Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.018940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.646464Z digest=sha256:d0bdf2d803d8b50e6aa15b1310f0a48ed689569d1b6c1014ae1a401e65eb2544

Observation 45814632-f5bc-4067-a44e-6ebf4a9eda45 · outbound

This paper cites Blending Imitation and Reinforcement Learning for Robust Policy Improvement.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Blending Imitation and Reinforcement Learning for Robust Policy Improvement

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.651020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.651020Z digest=sha256:9b1f6d26716fb26d027daa1203db5b196d51350ab5f65b404a2c0111c402e2e4

Observation d68f1ad5-5c2d-4a3e-9463-91497975427c · outbound

This paper cites Active policy improvement from multiple black-box oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Active policy improvement from multiple black-box oracles

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.002550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.655982Z digest=sha256:0ffd75967b6aaef9f3947d38ba5b303734abfdf2ace9ff3ac4c1450fb4155699

Observation cbe878d8-589b-4a63-930d-8bb6f217e96f · outbound

This paper cites Entropy-reinforced planning with large language models for de novo drug discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Entropy-reinforced planning with large language models for de novo drug discovery

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.987215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.660687Z digest=sha256:763a6dabf19d81aa2602abc59f3661700f67555a577e0d36c21bb75f2e27c9b8

Observation abe3419c-4ce9-4b80-b31d-9602a5d27bf9 · outbound

This paper cites Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.972163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.665499Z digest=sha256:b1e1336e3aada9c6a7d9d033c266dbac71030c4df93c0ae26fd7891aac68ae9e

Observation f23e3ed9-0fd9-432a-96a1-000f1f2be132 · outbound

This paper cites Reinvent 4: Modern ai–driven generative molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinvent 4: Modern ai–driven generative molecule design

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.956432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.670541Z digest=sha256:bddfe46764a0273f75695b8c818c0a4d284d162b73243f19069da79e8266dca1

Observation 92dd2be8-1865-48ae-946d-fe2f337ae38d · outbound

This paper cites The different mechanisms of cancer drug resistance: a brief review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The different mechanisms of cancer drug resistance: a brief review

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.941167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.675183Z digest=sha256:a505e95091e57e890279bbe54472f6528ad803dafeb1f05fd08f168e3787e8d2

Observation e480c6e2-d2ed-4c25-b705-2a498bc9e1ba · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Playing Atari with Deep Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.679677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.679677Z digest=sha256:69fd205d09a66d76b547950a4c5d9e6f8f903bb70486f9166656c5c3c29b8df7

Observation 338e75be-78b2-4fd9-b61d-457709dea35e · outbound

This paper cites Exploring deep recurrent models with reinforcement learning for molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Exploring deep recurrent models with reinforcement learning for molecule design

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.926339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.684720Z digest=sha256:c15dc7a48bb4cdf0f7d684e9f10345e980cd7cfa22eb77ec73028e1af5253d06

Observation b4507f40-8c05-4b63-893c-b8f11b8e39df · outbound

This paper cites Molecular de-novo design through deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular de-novo design through deep reinforcement learning

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.911596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.689475Z digest=sha256:09160393877bf74f7bdad7af03703b1165d51cbac2e163588be920eee36f1136

Observation 63ed8f5a-6c28-4931-880e-9b09de5fc5cb · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.694293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.694293Z digest=sha256:01483c0f6ad177680f7b100c1f84312541743a155a53981ae6563b2cf0e7964d

Observation 05bb62f3-110c-4816-afd9-60a17d77301a · outbound

This paper cites Combinatorial enumeration of groups, graphs, and chemical compounds.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Combinatorial enumeration of groups, graphs, and chemical compounds

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.897575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.699598Z digest=sha256:247a9abcab1141f5bbcfa7290b7f28224a76849736e482ab33ed61ba543cdf56

Observation 324daebc-83d2-460e-9377-5d455a92e951 · outbound

This paper cites Alvinn: An autonomous land vehicle in a neural network.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Alvinn: An autonomous land vehicle in a neural network

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.883398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.704511Z digest=sha256:ecf0f3e1718f22bdf734082951d509b2ba7dfde99661d712a40f43786fc7b281

Observation 04c6d37d-e073-472f-8d33-a72063f62fd4 · outbound

This paper cites Deep reinforcement learning for de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for de novo drug design

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.868339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.709787Z digest=sha256:0e85ccf0039005731754974d5d2668c2cda63570e042d73ea02828e0b3f4466e

Observation 6360c346-a16e-4542-b7ff-68aeffca25f5 · outbound

This paper cites Drug repurposing: Progress, challenges and recommendations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drug repurposing: Progress, challenges and recommendations

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.853447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.714625Z digest=sha256:eec7571c16d8e08cf9e7452bec0d79c234724417ebc9eeae66cfe49345afa13c

Observation 82924bfc-aaeb-4363-9c18-367187623f97 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.719469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.719469Z digest=sha256:f84682ef803fbc76cd49698ded3e9c789c4386e26652ceaab21bb301056ffc59

Observation e6274477-7f12-4eb8-8b7f-b78cc1b06e12 · outbound

This paper cites Learning by playing solving sparse reward tasks from scratch.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning by playing solving sparse reward tasks from scratch

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.838474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.724522Z digest=sha256:e136c8ad2be91ecfac94cbcd1feeeeea4e7bec233e1c8b2e5a731243d5089073

Observation 9cf7afa3-b90c-453f-9ab1-185431ee459f · outbound

This paper cites Extended-connectivity fingerprints.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Extended-connectivity fingerprints

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.822920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.728977Z digest=sha256:d874fe8e02bb09fcbffdfa3a8dbad6b21ab1f8fe1a2ff8b5693072b4b29033d4

Observation 923c1ada-3d19-43c8-bf55-60a20962d984 · outbound

This paper cites Reinforcement and Imitation Learning via Interactive No-Regret Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement and Imitation Learning via Interactive No-Regret Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.733657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.733657Z digest=sha256:9a8195b63eb39f658d4309f6d66419c9b697b8f5785c662b49a44752fa006977

Observation 0f3302b8-5f07-40e5-a7e3-74df4faaa6cd · outbound

This paper cites A reduction of imitation learning and structured prediction to no-regret online learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reduction of imitation learning and structured prediction to no-regret online learning

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.807028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.738675Z digest=sha256:ea66f76d8d4467a25357217dc5ab9749c4a6c1df92d1cd147b0935f41b2fc7f2

Observation 08c26f04-fe45-446c-bb7e-c8d7bbe3b902 · outbound

This paper cites C5T5: Controllable Generation of Organic Molecules with Transformers.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization C5T5: Controllable Generation of Organic Molecules with Transformers

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.090606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.743339Z digest=sha256:2600a217966224522cb8ba69dbb74c8599704b9332564af1e95be5cc08561fd9

Observation e17aae1f-ad39-4e19-ad42-6afc84602047 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural Machine Translation of Rare Words with Subword Units

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.748664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.748664Z digest=sha256:2ee33301d7a7068101467262577dd00122d563a8f06bf237fc0365e72836e9f2

Observation 5178c9a0-2e29-46b7-b83a-c5196241925f · outbound

This paper cites Preference Ranking Optimization for Human Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Preference Ranking Optimization for Human Alignment

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.753720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.753720Z digest=sha256:f69f24e4ce6c46e7ee8ce7ec1e9671cd145058958d7f5bc8bdc0c270b9252aa6

Observation 10823088-7042-4c39-b78c-4c9fde3ca91f · outbound

This paper cites Deep reinforcement learning for multiparameter optimization in de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for multiparameter optimization in de novo drug design

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.790337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.758864Z digest=sha256:12e8837e2ec95a3ed297f2bd5e8e4021d51600f24869fc4d77ef6719907f5c01

Observation 37ee144e-2f30-4b2f-b5af-21356c0f20be · outbound

This paper cites ZINC15–ligand discovery for everyone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization ZINC15–ligand discovery for everyone

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.774076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.763559Z digest=sha256:6d6936a89751ee2bcbdbbaaf8d061de26ea685d8b605ee4fc3106c0b2d44077d

Observation 44a38208-e0ec-4566-a5d4-4d44c5fc3455 · outbound

This paper cites Learning to summarize with human feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to summarize with human feedback

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.758229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.768526Z digest=sha256:55cb47b3c239a8b76440df1a2f89eb9548b3a243da8a5e09e6666023becef915

Observation 15067d09-f0c6-4d66-9de7-7883d3521f85 · outbound

This paper cites Molsearch: search-based multi-objective molecular generation and property optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molsearch: search-based multi-objective molecular generation and property optimization

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.742320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.773329Z digest=sha256:8b93cd48c20de2559b29519e473c4a3de4b213f3c5283a326b728424e15c186e

Observation 469feec5-13f5-47f2-8e77-8d19c8129579 · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy gradient meth- ods for reinforcement learning with function approximation

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.726293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.778406Z digest=sha256:104463342d9e1de547d6e78db5fad2d1918f4bb4466ae2a7996980bf5dfd9245

Observation d3e42ab1-d33a-4709-affb-8a0690452915 · outbound

This paper cites Reinforcement learning for systems pharmacology-oriented and personalized drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement learning for systems pharmacology-oriented and personalized drug design

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.711259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.783054Z digest=sha256:1e81f3f8f44d7270c8e64345b1a48c57a0face93bee32e336d8c34324ac8f138

Observation 202f7111-55b2-412c-a7ae-549f1931acfe · outbound

This paper cites Drlinker: Deep reinforcement learning for optimization in fragment linking design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drlinker: Deep reinforcement learning for optimization in fragment linking design

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.694766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.788037Z digest=sha256:8b7e1d9a050c515a67ad18828b58437a82a77e90037179e22b918f9f974444f7

Observation e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc · outbound

This paper cites DeepMind Control Suite.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DeepMind Control Suite

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.793596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.793596Z digest=sha256:b7377d196cde0ae9d5a7979bb8262705e4fd590ad6fc61795d50b6d1c6c6654a

Observation 40b71e8d-b632-4ee5-9a72-464d617a31a7 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.799215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.799215Z digest=sha256:047485cbec3b6a6c3555b12758968dc4fb90345b4ce4b7ddabaca3737fcb6e95

Observation fec0ce4c-f3bf-4c3c-a04a-ce7dfaaf87a0 · outbound

This paper cites Matched molecular pair analysis in short: algorithms, applications and limitations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Matched molecular pair analysis in short: algorithms, applications and limitations

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.678824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.804399Z digest=sha256:db1bd779be8f252ba8bd07cb69c57623d349656f820bc430a32fe0f344998177

Observation 9a8ed734-2a4a-471a-84c4-28b01a56a7cc · outbound

This paper cites Benchmarking language-based docking models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Benchmarking language-based docking models

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.662679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.809172Z digest=sha256:aed29f44113d673437a0133eddf0436b993d2737be5b1ef6030a44b5c174cdf7

Observation 8bf24568-87e4-47ae-9c4b-bf637c89ade6 · outbound

This paper cites Attention is all you need.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Attention is all you need

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.813976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.813976Z digest=sha256:4bf50beff1bcf082498189467e4487b5f2b2dd19ef76b60147bd62d82b91816a

Observation 52f6e24d-3e2b-4499-baeb-dc4bc2aab748 · outbound

This paper cites Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.818690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.818690Z digest=sha256:65549a57d5a922c24378b7c9a51323363a9ff5efa7fd95351e4a6eafbdde965c

Observation edcf64a5-0810-4c24-a6e8-afa7a4f859d0 · outbound

This paper cites A reinforcement learning approach for protein–ligand binding pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reinforcement learning approach for protein–ligand binding pose prediction

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.635880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.823746Z digest=sha256:5efd8ea4508991bf3feaca63803b7f7c3edd98f517ebf5c30d2c55584d0e0a7d

Observation f994b61a-7269-49dd-8090-b8f1ec351a08 · outbound

This paper cites Smiles, a chemical language and information system.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Smiles, a chemical language and information system

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.619981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.829086Z digest=sha256:9d0186e9201817d2589d49d4f027080a83b1b0d3fddf0ce4af20b81f0d92ba42

Observation 8b7c7211-8225-4e6a-b98a-6183fba0b0d5 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.604580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.833793Z digest=sha256:a84a77ee7cd6608bd596fb2d2f0500592a495aba488e11b06f534b2016bee740

Observation 58fa5c6a-c918-4eaa-9ef0-b8dc150444d3 · outbound

This paper cites Recursively Summarizing Books with Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Recursively Summarizing Books with Human Feedback

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.838714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.838714Z digest=sha256:fabbcb5bef8c95221ebd9b4b922d63e78806399859472a822066e4758edd0cfd

Observation af742400-5b96-4b63-823e-c8c6b4b59aca · outbound

This paper cites Rlcg: When reinforce- ment learning meets coarse graining.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rlcg: When reinforce- ment learning meets coarse graining

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.588909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.844060Z digest=sha256:9a2fd8e73e667b8da1ca0e032b435c42e157a817185804233e090703142a2546

Observation dba36a93-4910-49b2-9b99-285bbd402e00 · outbound

This paper cites Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.848704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.848704Z digest=sha256:519cc64c6e4a3fc117392db30d907b2faaf8587061d77aed100b78a9bce50bbc

Observation a1231f94-5d75-4426-8925-59a0c3e6d2bc · outbound

This paper cites Population-based de novo molecule generation, using grammatical evolution.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Population-based de novo molecule generation, using grammatical evolution

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.572547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.854230Z digest=sha256:9ca06bf8642fdb82b8371949e45c24523389b10aa58078004a7461d1492f4870

Observation 45f5e9b4-6aea-412f-9781-7ea6f37df6f9 · outbound

This paper cites Graph convolutional policy network for goal-directed molecular graph generation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Graph convolutional policy network for goal-directed molecular graph generation

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.555221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.858943Z digest=sha256:21ebde59c32a6da0ec5eaa5de5c9846d40e1501467b7244decc3b4013f6cdf84

Observation 3ebf7b5d-0ca2-4611-99a3-a929bb3607b9 · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.539385Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.863986Z digest=sha256:f85d39cbfb924035a2c2e6e9525cd1d02930de6e18196e240856a6b30d9a8370

Observation 0959e6bb-b69f-4519-b139-d1afefd35b8d · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.869139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.869139Z digest=sha256:7dff943e308456184dbb49818cc38bfb1dc73685c880047f935d25ddc247ac27

Observation 910f057e-941d-4419-be53-bfbc0764eb8d · outbound

This paper cites Covid-19 pathophysiology: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 pathophysiology: A review

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.523296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.874390Z digest=sha256:26b827ce057360bf5fb026c27a4819f158e988d9c6e72a5db919fc0782d3bdbc

Observation 3e9b7808-5ea1-409d-92de-313d0a645cb9 · outbound

This paper cites Universal approach to de novo drug design for target proteins using deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Universal approach to de novo drug design for target proteins using deep reinforcement learning

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.508183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.879206Z digest=sha256:78effcd05fba1b9c7ccbe2db2f2b656d733129aab2a1d5084ff1e47af04db730

Observation eef72f93-4f95-40c2-8916-4eb13c4799fc · outbound

This paper cites Optimization of molecules via deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Optimization of molecules via deep reinforcement learning

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.491284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-08T13:29:10.884009Z digest=sha256:997e0e33c7220040060879cc7be3cfab281fb6a9374761cda593d44833ba8277

Observation b5fe6846-2656-4838-8bc3-70065bc8adff · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Fine-Tuning Language Models from Human Preferences

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.888735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.888735Z digest=sha256:b4201994eeb7bbf431a1a8d62ba8cb14e95025f2535df8447d69086f75299bc8

Pith citing papers

No inbound Pith citation observations are available.