{"as_of":"2026-08-09T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc2e36b440b09c35b30c3b25952ecd3133d406bbf59a10556447bd12bcd89020","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:29:10.888735Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07237/citation-record","integrity":"/paper/2502.07237/integrity","json":"/paper/2502.07237/citation-record.json","paper":"/paper/2502.07237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.451377Z","title":"De novo drug design using reinforcement learning with graph-based deep generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.451377Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b40fcdf9061d43b80770cbfde0333a4325a566f6fb5ded6baf8c5f5b4aa1cccd","observation_id":"23139c04-27bb-4f7e-813b-580216ed1d9f","resolution":{"observed_at":"2026-08-08T13:29:10.451377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.456789Z","title":"DrugCentral 2023 extends human clinical data and integrates veterinary drugs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.456789Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f1acbfad582a3c449cd29e1edd8a968068d19a74ff7b893c9425488fc036ffa2","observation_id":"9d0e9410-cafb-4473-8484-46ad1e2101fb","resolution":{"observed_at":"2026-08-08T13:29:10.456789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.461807Z","title":"MolGPT: Molecular generation using a transformer-decoder model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.461807Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:31919a918dbe5ccbdd42303a5178363de6022b118d396e1500392e5a5c9e6b82","observation_id":"094e99f4-dcb2-4b13-bcd7-7b6683564a28","resolution":{"observed_at":"2026-08-08T13:29:10.461807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-08T13:29:10.467246Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.467246Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:08a34d401ee14f671678137745a3d9c408f7e82a5cb59cad1f30114f4ae287cc","observation_id":"ccb5f472-fa15-445f-bb50-8fa447178299","resolution":{"observed_at":"2026-08-08T13:29:10.467246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-08T13:29:10.472852Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.472852Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:8b2714e67d688c25774e7a25760bf02400db694117aeceeb3e9ac908b13c397c","observation_id":"82d291ee-f4ce-4ba9-b9d1-b0baf5213678","resolution":{"observed_at":"2026-08-08T13:29:10.472852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.478424Z","title":"Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.478424Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:092875793e9252a8f093b5665c9658825526afea51b29338de1c26f1597214de","observation_id":"1fb99ddb-7d6c-4982-8791-c187bf18704c","resolution":{"observed_at":"2026-08-08T13:29:10.478424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.483408Z","title":"Molecular similarity: a key technique in molecular informatics","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.483408Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:da4fe278da25eec98683e50210b69f9c0f80b96f78690b0fe450e76105734864","observation_id":"8cec44a0-b99d-494d-894c-40502357271f","resolution":{"observed_at":"2026-08-08T13:29:10.483408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01214","last_updated":"2019-09-03T14:30:13Z","snapshot_observed_at":"2026-07-06T08:18:43.473503Z","submitted_at":"2019-09-03T14:30:13Z","title":"Better Rewards Yield Better Summaries: Learning to Summarise Without References","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01214","snapshot_observed_at":"2026-08-08T13:29:10.488851Z","title":"Better rewards yield better summaries: Learning to summarise without references","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.488851Z"},"links":{"cited_paper":"/paper/1909.01214","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:21669497e9783704448e7ebf4fb9accac8984e0b0719a042d648794eaf325aa6","observation_id":"908a204e-7b65-4486-828e-6f67e9028956","resolution":{"observed_at":"2026-08-08T13:29:10.488851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.493944Z","title":"Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.493944Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:fdb40e4ee67489c8ccbe5e3f144b733567dc8a18482b4b49c2155c2f16bdbef8","observation_id":"36739dfb-d947-46c7-a108-9d1f8d560c50","resolution":{"observed_at":"2026-08-08T13:29:10.493944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06083","last_updated":"2023-10-09T18:40:04Z","snapshot_observed_at":"2026-08-06T20:54:44.673745Z","submitted_at":"2023-10-09T18:40:04Z","title":"Transformers and Large Language Models for Chemistry and Drug Discovery","version":1},"cited_work":{"arxiv_id":"2310.06083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06083","snapshot_observed_at":"2026-08-08T13:29:11.417873Z","title":"Transformers and Large Language Models for Chemistry and Drug Discovery","venue":"cs.LG","work_id":"e591d9bb-b148-4cdf-bdaf-3fec409e23ce","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.498827Z"},"links":{"cited_paper":"/paper/2310.06083","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e99cc5361d9d315837011afaaf3e9b09e771e9e861baeb2e382960c967a6ab9e","observation_id":"0a097645-0b34-49a0-99ab-973421e42fee","resolution":{"observed_at":"2026-08-08T13:29:11.423383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.504287Z","title":"Offline rl without off-policy evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.504287Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1c086cc84e0c7dee01a308f82c2681da679f667a82cb93dff4ceeadee3731c24","observation_id":"6a5f96de-cb61-450e-bbcb-094a52ef9aaf","resolution":{"observed_at":"2026-08-08T13:29:10.504287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.509689Z","title":"Safe learning in robotics: From learning-based control to safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.509689Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:87e69e3b8227e65d4173f922a758aa1c75746b91ae3f490cdc5ec77e336f76e4","observation_id":"f5663653-79bf-4e7d-83ff-f771d6600718","resolution":{"observed_at":"2026-08-08T13:29:10.509689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.320989Z","title":"Policy improvement via imitation of multiple oracles","venue":null,"work_id":"6802ab26-0547-4a57-ba35-061eb2560c47","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.514629Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:5c5286a6be7dc678daf7d1acce263b33caf5c1374da3efcd875c86922032111e","observation_id":"b206893b-d305-46af-9ba2-a6d27ec1fd6e","resolution":{"observed_at":"2026-08-08T13:29:12.326377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.305828Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"56aef8bf-20eb-4f58-af1f-e2b15a88a307","year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.519703Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d2b863983c692d37b440c7ec7cdea1079930958eefaa92c3249ac8f1528d80a4","observation_id":"ffe4e10b-1f35-416f-9024-d5175ba07ca6","resolution":{"observed_at":"2026-08-08T13:29:12.310763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.290768Z","title":"Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection","venue":null,"work_id":"3f8e2b59-3354-491c-a270-39c0d59fe29d","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.524690Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a2df997f58402a29ef2442ccb3ce733807c117aeadb9198e0bad2bb2a63cfd9f","observation_id":"6d6b85ae-ff03-40d4-8545-30fe36030596","resolution":{"observed_at":"2026-08-08T13:29:12.295680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.275255Z","title":"The cost of new drug discovery and development","venue":null,"work_id":"1297d79f-5099-439a-aeed-41a3e5cd0f81","year":2009},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.529941Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:afac2aeea6c06d8bbcdabb8e0f648fd9c299b505c1e7c0d66cb6dd34d960cb24","observation_id":"f8011063-e22b-4fe0-b4c1-f863cc232dce","resolution":{"observed_at":"2026-08-08T13:29:12.280350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-08T13:29:10.536482Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.536482Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:921cd072da34f194cecdd6c68be89c5b30e581479bb6cf1ad636b5e765ca8916","observation_id":"6408ef31-5451-4b82-9dd6-5bc38750038f","resolution":{"observed_at":"2026-08-08T13:29:10.536482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.259984Z","title":"Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions","venue":null,"work_id":"a75b7175-e38c-4bfb-8493-10e6243c3447","year":2009},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.541731Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c22a445bfbf4116302ffbd1996c87ead6d6a97fc5bca0cbcd3805c1716f5815f","observation_id":"dbbe1424-7a55-4100-9f5e-7cd3bad2a6dc","resolution":{"observed_at":"2026-08-08T13:29:12.264876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.244901Z","title":"Neural scaling of deep chemical models","venue":null,"work_id":"436cb571-7b6b-410e-91ff-a7e19f9525e5","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.546660Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:97df285dee9ab83613127e3320afde776f3094fcd46290465fb8a698389f83ae","observation_id":"e225d3ef-bfcd-48bb-a2cc-4e3f05adb878","resolution":{"observed_at":"2026-08-08T13:29:12.249858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.229600Z","title":"Mimosa: Multi-constraint molecule sampling for molecule optimization","venue":null,"work_id":"358a717a-6327-4bcf-8feb-062fd8477caa","year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.551668Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0cbc070d8ebbc754fa97fdade721d0f581a76319276e8bba98e0ba351ecf7836","observation_id":"99205759-fa1f-4eba-8e4d-fd3042074733","resolution":{"observed_at":"2026-08-08T13:29:12.234419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.214023Z","title":"A new algorithm for data compression","venue":null,"work_id":"5a9d8ced-a86b-4b33-bb4c-7738faeb777e","year":1994},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.556435Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9e2975a65e6ce3bd6d7a3e4594983de085229da932a9c4ecdfb4af72ffddf8b9","observation_id":"4a7f36a5-e36b-4f42-b179-3ffa4f7b6085","resolution":{"observed_at":"2026-08-08T13:29:12.218993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.197854Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"96c30e5e-0490-4958-b992-f3d665560e1b","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.561585Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7d67a2ef03b35721abd0ffb9387a925250452f83c3d7a813b33c258d425f9f3c","observation_id":"b376e5c0-8b05-4431-ad25-18d3f51c0417","resolution":{"observed_at":"2026-08-08T13:29:12.203370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.182608Z","title":"Learning to navigate the synthetically accessible chemical space using reinforcement learning","venue":null,"work_id":"100f398c-74d7-4cdb-9748-3ba5170098ad","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.566706Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:fd45831d28dc148364ae2a40d1f26be7e8df6d244147a44b3035c47d41599615","observation_id":"e21d29d2-23bd-4f8d-906e-1ae1ef185db7","resolution":{"observed_at":"2026-08-08T13:29:12.187597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10843","last_updated":"2018-02-07T04:58:57Z","snapshot_observed_at":"2026-07-31T23:26:47.539311Z","submitted_at":"2017-05-30T19:58:08Z","title":"Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10843","snapshot_observed_at":"2026-08-08T13:29:10.571560Z","title":"Objective-reinforced generative adversarial networks (ORGAN) for sequence generation models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.571560Z"},"links":{"cited_paper":"/paper/1705.10843","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e34669f71cad75a31ca2376074de3693cefd931709e38c21ab5fa09ee83c30d4","observation_id":"d32b5402-a510-45ef-b87b-616781316bb6","resolution":{"observed_at":"2026-08-08T13:29:10.571560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.167273Z","title":"Covid-19 vaccines and variants of concern: A review","venue":null,"work_id":"cfe4e3c2-d204-4d46-9b02-a516a4dc7d82","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.576746Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:3a3daaee4ae9f3e1c4d2aa49e3970d68e11f2bde1c67d430e08a49c693e9711a","observation_id":"b7304e96-c6e4-4c95-91ca-e36e862cec1b","resolution":{"observed_at":"2026-08-08T13:29:12.172238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.05415","last_updated":"2019-06-13T06:01:04Z","snapshot_observed_at":"2026-08-09T16:02:35.397999Z","submitted_at":"2019-01-16T18:02:44Z","title":"Learning from Dialogue after Deployment: Feed Yourself, Chatbot!","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.05415","snapshot_observed_at":"2026-08-08T13:29:10.581537Z","title":"Learning from dialogue after deployment: Feed yourself, chatbot! arXiv preprint arXiv:1901.05415, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.581537Z"},"links":{"cited_paper":"/paper/1901.05415","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:58a839d4bd3ce37f29b4e66bdb678b9e2189840b7715d49f0a57a47fce37bb1a","observation_id":"0e52c434-b836-469b-ab68-9ec432686a76","resolution":{"observed_at":"2026-08-08T13:29:10.581537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.151322Z","title":"Molecular optimization by capturing chemist’s intuition using deep neural networks","venue":null,"work_id":"6e740e88-852d-447f-b411-d835be355d8f","year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.587407Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b40a753ceb1c404ca22470597988e782c8b389693f95cfa96125540fcac426f0","observation_id":"114d79ca-e711-4826-a1ba-021da26e1722","resolution":{"observed_at":"2026-08-08T13:29:12.156432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.136352Z","title":"Transformer-based molecular optimization beyond matched molecular pairs","venue":null,"work_id":"2f68c9af-f46c-4a86-bc83-d8bc5e9046da","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.592697Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:321f9ada9f3de525bd2e9da8320d8bc592a5d1fcddec8985bbc7011878f6cd0f","observation_id":"dde8d5c8-2416-45be-b872-05cb4270c05b","resolution":{"observed_at":"2026-08-08T13:29:12.141145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.121396Z","title":"Reward learning from human preferences and demonstrations in atari","venue":null,"work_id":"0e37f24f-d9b6-499e-8272-91fe06964c32","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.597480Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:de295de46eea1eac2717faa7e45b20042520a68778a5fb3635066e70a17fe850","observation_id":"5c1a2ea6-fde2-4a2b-9334-ec8c4e6932d3","resolution":{"observed_at":"2026-08-08T13:29:12.126101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.106559Z","title":"The distribution of the flora in the alpine zone","venue":null,"work_id":"1872b662-eba7-4cc9-bcf7-ddbe0f204c0b","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.601947Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c68512647ed2b753e3776b2631d23a1b4e09e416d8bc99f796f78a09db073468","observation_id":"ae7472bf-2b7d-46c6-8e9a-b17704c9eefa","resolution":{"observed_at":"2026-08-08T13:29:12.111431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-08T13:29:10.606901Z","title":"Way off-policy batch deep reinforcement learning of implicit human preferences in dialog","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.606901Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d09095ba873fc6e2dfd3605fa052d352cfad0fd39b0959fd5d668e5b166d5179","observation_id":"aa297f5a-ade7-4a7d-b120-6cebc83fd29e","resolution":{"observed_at":"2026-08-08T13:29:10.606901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.091868Z","title":"A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space","venue":null,"work_id":"32c042e9-6b9a-44d9-bd24-b80a6e25202f","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.612042Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f6df8b56af7816bb9de5551cf5453ec02384323d0c90aecc99a77908407125b2","observation_id":"fece7bd0-12ae-4d39-b813-073e94735335","resolution":{"observed_at":"2026-08-08T13:29:12.096586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.076058Z","title":"Multi-objective molecule generation using interpretable substructures","venue":null,"work_id":"f9901a32-8301-40a0-9699-771c8420c9ee","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.616638Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:dff17a8ace9b3450b396495b4b2b7b1f1511bea13f9906b896e3944b3b787176","observation_id":"9d3aabbc-ec55-47f2-a8b1-249e90dd010c","resolution":{"observed_at":"2026-08-08T13:29:12.081061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.060711Z","title":"Posit: flexible shape-guided docking for pose prediction","venue":null,"work_id":"0e6839bd-f046-4e1b-a7df-60fff0854b1e","year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.621388Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:101c64c7ac983cdc5467739da87115ada9cd5a46e3d659a55170d76a497ae807","observation_id":"cb0cd3ed-101b-4b17-afec-2b76042e4c5b","resolution":{"observed_at":"2026-08-08T13:29:12.065686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01549","last_updated":"2015-09-14T15:42:35Z","snapshot_observed_at":"2026-07-06T04:28:51.025619Z","submitted_at":"2015-09-04T18:21:52Z","title":"Giraffe: Using Deep Reinforcement Learning to Play Chess","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01549","snapshot_observed_at":"2026-08-08T13:29:10.626000Z","title":"Giraffe: Using deep reinforcement learning to play chess","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.626000Z"},"links":{"cited_paper":"/paper/1509.01549","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a8604bc43414a5713c499ad104511227122e99b6181ce209bf00f32625b3dfdc","observation_id":"a001709c-5cf6-4e19-b714-4d43d8d6c97e","resolution":{"observed_at":"2026-08-08T13:29:10.626000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.045574Z","title":"RDkit: Open-source cheminformatics software","venue":null,"work_id":"ef5036dd-b715-463b-bf12-d72e3e6a4d67","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.631332Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c3ced1aa4225e6829878565c13993a741e04eeb4a1d4ec956f74bf661555a913","observation_id":"c7eed6fe-8191-457f-afc1-e099f4c25882","resolution":{"observed_at":"2026-08-08T13:29:12.050462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.029477Z","title":"Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling","venue":null,"work_id":"9c776c4b-974a-4cfe-8c68-9dbd0f7f280d","year":2013},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.635987Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:44074672f840516f6d9e240844a17e190fdee24bd28f0b8f5921718755e20c72","observation_id":"7a663836-d1df-4baa-96fd-3b8c2d7ed932","resolution":{"observed_at":"2026-08-08T13:29:12.034338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-08T13:29:10.640998Z","title":"Scalable agent alignment via reward modeling: A research direction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.640998Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:8297bc592bb39f13f80f692f11247e415996d8a29255de680dad79b7d90b0611","observation_id":"f8dccded-8c51-48f6-b699-731479c7493b","resolution":{"observed_at":"2026-08-08T13:29:10.640998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.013565Z","title":"Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization","venue":null,"work_id":"cd8d5501-cc98-496e-8871-12e4dd9d789c","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.646464Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:de7dd4dbd9daacb26eb12adf1b73fc3c0e90875fb0c32b3be20c357877cf1436","observation_id":"1a7dd7a7-bef0-403e-a139-deb71922ae6e","resolution":{"observed_at":"2026-08-08T13:29:12.018940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01737","last_updated":"2025-08-11T01:00:11Z","snapshot_observed_at":"2026-08-05T01:39:51.497362Z","submitted_at":"2023-10-03T01:55:54Z","title":"Blending Imitation and Reinforcement Learning for Robust Policy Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01737","snapshot_observed_at":"2026-08-08T13:29:10.651020Z","title":"Blend- ing imitation and reinforcement learning for robust policy improvement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.651020Z"},"links":{"cited_paper":"/paper/2310.01737","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9b1f6d26716fb26d027daa1203db5b196d51350ab5f65b404a2c0111c402e2e4","observation_id":"45814632-f5bc-4067-a44e-6ebf4a9eda45","resolution":{"observed_at":"2026-08-08T13:29:10.651020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.997646Z","title":"Active policy improvement from multiple black-box oracles","venue":null,"work_id":"ff5c17d5-5c2e-4552-a410-6c9078563b1b","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.655982Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:cb3cdb0dffca4042d98f206b1c30eef7495a99f9796336d50de7a74287d01e57","observation_id":"d68f1ad5-5c2d-4a3e-9463-91497975427c","resolution":{"observed_at":"2026-08-08T13:29:12.002550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.982093Z","title":"Entropy-reinforced planning with large language models for de novo drug discovery","venue":null,"work_id":"1e7d0a69-4b32-4226-9c2f-0394aed49d14","year":2024},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.660687Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e1a35ce351bdbb59aa49c2945d9362a675817996cca5c3c226920895edb2f3bf","observation_id":"cbe878d8-589b-4a63-930d-8bb6f217e96f","resolution":{"observed_at":"2026-08-08T13:29:11.987215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.966613Z","title":"Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning","venue":null,"work_id":"d6b53f4d-a19c-43d6-8592-dbc1eae59424","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.665499Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:13eba0436cd6fabb07608baaaa81ec572c4b57a01012d3ee6588c80b3d0aa383","observation_id":"abe3419c-4ce9-4b80-b31d-9602a5d27bf9","resolution":{"observed_at":"2026-08-08T13:29:11.972163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.951290Z","title":"Reinvent 4: Modern ai–driven generative molecule design","venue":null,"work_id":"50ffd6b1-b8d3-418d-a751-6acaaf77bdd7","year":2024},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.670541Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:59e42d68150aa2a29e3873e4347fc3c865b73405ee94b775bb0d41b9d1de1a31","observation_id":"f23e3ed9-0fd9-432a-96a1-000f1f2be132","resolution":{"observed_at":"2026-08-08T13:29:11.956432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.936229Z","title":"The different mechanisms of cancer drug resistance: a brief review","venue":null,"work_id":"199a64dc-54e4-45fb-9b6e-42391be57977","year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.675183Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1ec119b5f5f62ed9921914c6238684db121cf65ad71909357b2ad216c5c32d3d","observation_id":"92dd2be8-1865-48ae-946d-fe2f337ae38d","resolution":{"observed_at":"2026-08-08T13:29:11.941167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-08T13:29:10.679677Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.679677Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:69fd205d09a66d76b547950a4c5d9e6f8f903bb70486f9166656c5c3c29b8df7","observation_id":"e480c6e2-d2ed-4c25-b705-2a498bc9e1ba","resolution":{"observed_at":"2026-08-08T13:29:10.679677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.921592Z","title":"Exploring deep recurrent models with reinforcement learning for molecule design","venue":null,"work_id":"408b27c2-f9df-446d-a793-726253685f37","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.684720Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:896305b84ab235324cb50e480b77608c4220aacd40100b34daefccab34104944","observation_id":"338e75be-78b2-4fd9-b61d-457709dea35e","resolution":{"observed_at":"2026-08-08T13:29:11.926339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.906943Z","title":"Molecular de-novo design through deep reinforcement learning","venue":null,"work_id":"11cfa8e7-118a-4641-8975-6e3323d6c7bf","year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.689475Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d715bdc6b2fb15a1f81f0b5fcd26ca97a8c3d30c230c2f745e1c82bb8f41ec32","observation_id":"b4507f40-8c05-4b63-893c-b8f11b8e39df","resolution":{"observed_at":"2026-08-08T13:29:11.911596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-08T13:29:10.694293Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.694293Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:01483c0f6ad177680f7b100c1f84312541743a155a53981ae6563b2cf0e7964d","observation_id":"63ed8f5a-6c28-4931-880e-9b09de5fc5cb","resolution":{"observed_at":"2026-08-08T13:29:10.694293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.893195Z","title":"Combinatorial enumeration of groups, graphs, and chemical compounds","venue":null,"work_id":"a4550d89-5360-4de8-b57c-372d2a0fb8f8","year":2012},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.699598Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:dd41d2ea12c9ae4adcd899ac49a03f028399861f0dc8c66adc856dcdc4e443fa","observation_id":"05bb62f3-110c-4816-afd9-60a17d77301a","resolution":{"observed_at":"2026-08-08T13:29:11.897575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.878619Z","title":"Alvinn: An autonomous land vehicle in a neural network","venue":null,"work_id":"07058ffe-3cd8-4c70-92ab-c75f6724db8b","year":1988},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.704511Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:10bd210c99b64ebcb260eb7f7bdec8ee9c3f9b5de8d800fee0c850db51cfc330","observation_id":"324daebc-83d2-460e-9377-5d455a92e951","resolution":{"observed_at":"2026-08-08T13:29:11.883398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.863506Z","title":"Deep reinforcement learning for de novo drug design","venue":null,"work_id":"714a0da2-cfb7-48ed-aa68-f6434b304e72","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.709787Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:babb9adece5617bc3874f31c7da316c42b0a4d28b27b8cd128b4b735fab4f40f","observation_id":"04c6d37d-e073-472f-8d33-a72063f62fd4","resolution":{"observed_at":"2026-08-08T13:29:11.868339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.848685Z","title":"Drug repurposing: Progress, challenges and recommendations","venue":null,"work_id":"5c164867-045d-4ef9-a6ba-b386c50b0d69","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.714625Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:2b94cad0cc6d2a25763c97f17eef4da8c77f44c28473c366d8290618edba16d6","observation_id":"6360c346-a16e-4542-b7ff-68aeffca25f5","resolution":{"observed_at":"2026-08-08T13:29:11.853447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-08T13:29:10.719469Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.719469Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f84682ef803fbc76cd49698ded3e9c789c4386e26652ceaab21bb301056ffc59","observation_id":"82924bfc-aaeb-4363-9c18-367187623f97","resolution":{"observed_at":"2026-08-08T13:29:10.719469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.833446Z","title":"Learning by playing solving sparse reward tasks from scratch","venue":null,"work_id":"79adb9a4-ac36-4a83-970b-b9843f571030","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.724522Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:59e73063ba0af18c0e6653e5ff7d39fa5c55be4484d7ff4a6e2114343d4631d2","observation_id":"e6274477-7f12-4eb8-8b7f-b78cc1b06e12","resolution":{"observed_at":"2026-08-08T13:29:11.838474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.817842Z","title":"Extended-connectivity fingerprints","venue":null,"work_id":"cb505f32-3bfb-4dd8-9556-519e00cd66ab","year":2010},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.728977Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b4573351e3c383ff98a7db28dfc7c7e629857521bb0566290eadc6ed9ab62f90","observation_id":"9cf7afa3-b90c-453f-9ab1-185431ee459f","resolution":{"observed_at":"2026-08-08T13:29:11.822920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-08-08T13:29:10.733657Z","title":"Reinforcement and imitation learning via interactive no-regret learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.733657Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9a8195b63eb39f658d4309f6d66419c9b697b8f5785c662b49a44752fa006977","observation_id":"923c1ada-3d19-43c8-bf55-60a20962d984","resolution":{"observed_at":"2026-08-08T13:29:10.733657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.801686Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"0e9178e5-45b0-4bf9-9b68-77ac8de58182","year":2011},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.738675Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:78a1992bc1a0e8eea43aea84050827050dc9be9c5cfdd24c3ede87c65855846e","observation_id":"0f3302b8-5f07-40e5-a7e3-74df4faaa6cd","resolution":{"observed_at":"2026-08-08T13:29:11.807028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10307","last_updated":"2021-08-23T17:53:07Z","snapshot_observed_at":"2026-08-06T03:20:55.504286Z","submitted_at":"2021-08-23T17:53:07Z","title":"C5T5: Controllable Generation of Organic Molecules with Transformers","version":1},"cited_work":{"arxiv_id":"2108.10307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.10307","snapshot_observed_at":"2026-08-08T13:29:11.082574Z","title":"C5T5: Controllable Generation of Organic Molecules with Transformers","venue":"cs.LG","work_id":"7765daa6-6656-4020-a9a4-ca1f9f80000a","year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.743339Z"},"links":{"cited_paper":"/paper/2108.10307","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e0c63f132ec41dee9a135e3f7e7946c6fe617977899eed2c9ebbaae12c86c161","observation_id":"08c26f04-fe45-446c-bb7e-c8d7bbe3b902","resolution":{"observed_at":"2026-08-08T13:29:11.090606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-08T13:29:10.748664Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.748664Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:2ee33301d7a7068101467262577dd00122d563a8f06bf237fc0365e72836e9f2","observation_id":"e17aae1f-ad39-4e19-ad42-6afc84602047","resolution":{"observed_at":"2026-08-08T13:29:10.748664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17492","last_updated":"2024-02-27T18:42:42Z","snapshot_observed_at":"2026-08-02T19:39:02.664535Z","submitted_at":"2023-06-30T09:07:37Z","title":"Preference Ranking Optimization for Human Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17492","snapshot_observed_at":"2026-08-08T13:29:10.753720Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.753720Z"},"links":{"cited_paper":"/paper/2306.17492","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f69f24e4ce6c46e7ee8ce7ec1e9671cd145058958d7f5bc8bdc0c270b9252aa6","observation_id":"5178c9a0-2e29-46b7-b83a-c5196241925f","resolution":{"observed_at":"2026-08-08T13:29:10.753720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.784818Z","title":"Deep reinforcement learning for multiparameter optimization in de novo drug design","venue":null,"work_id":"f417ec54-b725-4e9b-ac1f-87c7d569ba41","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.758864Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a8a9059ff66256973139687d065f781198c999b607423596dbf0c929722da259","observation_id":"10823088-7042-4c39-b78c-4c9fde3ca91f","resolution":{"observed_at":"2026-08-08T13:29:11.790337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.768857Z","title":"ZINC15–ligand discovery for everyone","venue":null,"work_id":"b0f5f1ee-4587-433e-a866-3bc3d1160f59","year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.763559Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0d8bad8297e222a6a51bbb4d3b73520441285600250086ce867106d9fdf79ed4","observation_id":"37ee144e-2f30-4b2f-b5af-21356c0f20be","resolution":{"observed_at":"2026-08-08T13:29:11.774076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.753068Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"89b2301f-ec2f-4929-916d-99876ec36884","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.768526Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:100a77c7b81c0595d77206369f459d130fa9b08b8330aea79b9fe597499f445a","observation_id":"44a38208-e0ec-4566-a5d4-4d44c5fc3455","resolution":{"observed_at":"2026-08-08T13:29:11.758229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.737509Z","title":"Molsearch: search-based multi-objective molecular generation and property optimization","venue":null,"work_id":"a4070b05-d921-4152-9618-7de62d07999a","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.773329Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9b8a30f6a289230ec112d2f0b66b1988111a1c3d89175e54f79540b243c5ee26","observation_id":"15067d09-f0c6-4d66-9de7-7883d3521f85","resolution":{"observed_at":"2026-08-08T13:29:11.742320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.721614Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":"168fc7df-f969-4967-8285-690ee74fa219","year":1999},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.778406Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:76a2c00fbaed94a2ef5c9f6fdd38b3b99bccf7648c323a98000ffe660b350888","observation_id":"469feec5-13f5-47f2-8e77-8d19c8129579","resolution":{"observed_at":"2026-08-08T13:29:11.726293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.705344Z","title":"Reinforcement learning for systems pharmacology-oriented and personalized drug design","venue":null,"work_id":"2003ca89-ad37-4073-a15d-ac12a93cc142","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.783054Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c17ee9134a6a24d588518a094a2909871ba1818d7b0ed85305b1c5d6ce3b48ea","observation_id":"d3e42ab1-d33a-4709-affb-8a0690452915","resolution":{"observed_at":"2026-08-08T13:29:11.711259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.689680Z","title":"Drlinker: Deep reinforcement learning for optimization in fragment linking design","venue":null,"work_id":"9e8642c1-47b6-41d6-9b3d-60adecd3e9ce","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.788037Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9a420781ee2121ba66d0028e748f2bcf32df45fd7fb7c3830b18e37675fb165b","observation_id":"202f7111-55b2-412c-a7ae-549f1931acfe","resolution":{"observed_at":"2026-08-08T13:29:11.694766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T13:29:10.793596Z","title":"DeepMind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.793596Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b7377d196cde0ae9d5a7979bb8262705e4fd590ad6fc61795d50b6d1c6c6654a","observation_id":"e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc","resolution":{"observed_at":"2026-08-08T13:29:10.793596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T13:29:10.799215Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.799215Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:047485cbec3b6a6c3555b12758968dc4fb90345b4ce4b7ddabaca3737fcb6e95","observation_id":"40b71e8d-b632-4ee5-9a72-464d617a31a7","resolution":{"observed_at":"2026-08-08T13:29:10.799215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.673839Z","title":"Matched molecular pair analysis in short: algorithms, applications and limitations","venue":null,"work_id":"02e873db-b7e3-402f-b9ae-02e47eb6eb78","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.804399Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c3c3978583813304a5b0853398b0e0b1c16cc2f78b42d70fbd97c3e29d178eca","observation_id":"fec0ce4c-f3bf-4c3c-a04a-ce7dfaaf87a0","resolution":{"observed_at":"2026-08-08T13:29:11.678824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.657831Z","title":"Benchmarking language-based docking models","venue":null,"work_id":"737c7a0d-0189-4bf0-a2a3-082f2cee4cb4","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.809172Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a512e70c294383473e0c082f91c26ad81db6e241bc47d6ae39fa94b775715446","observation_id":"9a8ed734-2a4a-471a-84c4-28b01a56a7cc","resolution":{"observed_at":"2026-08-08T13:29:11.662679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.813976Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.813976Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:4bf50beff1bcf082498189467e4487b5f2b2dd19ef76b60147bd62d82b91816a","observation_id":"8bf24568-87e4-47ae-9c4b-bf637c89ade6","resolution":{"observed_at":"2026-08-08T13:29:10.813976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-02T04:07:03.272158Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-08T13:29:10.818690Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.818690Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:2d0a27b5b576a9d8de5c73243497d71c54dd132e5d962d8f8faef11e16923d90","observation_id":"52f6e24d-3e2b-4499-baeb-dc4bc2aab748","resolution":{"observed_at":"2026-08-08T13:29:10.818690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.630768Z","title":"A reinforcement learning approach for protein–ligand binding pose prediction","venue":null,"work_id":"56a6a12a-50fb-44e1-8b08-7b2e1d8968a7","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.823746Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:254fab5bbbbb746c015287552f93ea16acf03c991a263a8afe2b72d69538aac8","observation_id":"edcf64a5-0810-4c24-a6e8-afa7a4f859d0","resolution":{"observed_at":"2026-08-08T13:29:11.635880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.615042Z","title":"Smiles, a chemical language and information system","venue":null,"work_id":"47853606-fca9-4e0f-a069-ac025f168a3a","year":1988},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.829086Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:327b59e9d09bd497bc5bc19a59c78986a3d7dfe15114042018d4e3aff439c5a2","observation_id":"f994b61a-7269-49dd-8090-b8f1ec351a08","resolution":{"observed_at":"2026-08-08T13:29:11.619981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.599759Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":"38e50b32-d59f-4475-8e40-3f28c51b87dc","year":1992},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.833793Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:ed3f49cad386bc02729bb7300c41b39dac7aec00e22d124335b537a373db2cba","observation_id":"8b7c7211-8225-4e6a-b98a-6183fba0b0d5","resolution":{"observed_at":"2026-08-08T13:29:11.604580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10862","last_updated":"2021-09-27T21:12:49Z","snapshot_observed_at":"2026-08-04T13:56:39.444746Z","submitted_at":"2021-09-22T17:34:18Z","title":"Recursively Summarizing Books with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10862","snapshot_observed_at":"2026-08-08T13:29:10.838714Z","title":"Recursively summarizing books with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.838714Z"},"links":{"cited_paper":"/paper/2109.10862","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:fabbcb5bef8c95221ebd9b4b922d63e78806399859472a822066e4758edd0cfd","observation_id":"58fa5c6a-c918-4eaa-9ef0-b8dc150444d3","resolution":{"observed_at":"2026-08-08T13:29:10.838714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.583656Z","title":"Rlcg: When reinforce- ment learning meets coarse graining","venue":null,"work_id":"43fc72ae-c486-4243-b80c-e1597fa1030c","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.844060Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:03ae5ad034b006abc21dd147062dd97a8e25f17b5856d3fd7fe235b9313fb9ea","observation_id":"af742400-5b96-4b63-823e-c8c6b4b59aca","resolution":{"observed_at":"2026-08-08T13:29:11.588909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.13015","last_updated":"2019-11-22T03:06:41Z","snapshot_observed_at":"2026-08-06T01:18:31.633785Z","submitted_at":"2019-04-30T02:03:05Z","title":"Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.13015","snapshot_observed_at":"2026-08-08T13:29:10.848704Z","title":"Towards coherent and engaging spoken dialog response generation using automatic conversation evaluators","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.848704Z"},"links":{"cited_paper":"/paper/1904.13015","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:519cc64c6e4a3fc117392db30d907b2faaf8587061d77aed100b78a9bce50bbc","observation_id":"dba36a93-4910-49b2-9b99-285bbd402e00","resolution":{"observed_at":"2026-08-08T13:29:10.848704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.566915Z","title":"Population-based de novo molecule generation, using grammatical evolution","venue":null,"work_id":"052cb079-cca4-4368-8eef-1570d007b5df","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.854230Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d4a759e3f80ba23b189a92af3638dd0868d8c98cbdc874630138ef8ef079dda3","observation_id":"a1231f94-5d75-4426-8925-59a0c3e6d2bc","resolution":{"observed_at":"2026-08-08T13:29:11.572547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.550422Z","title":"Graph convolutional policy network for goal-directed molecular graph generation","venue":null,"work_id":"61948d90-e933-473d-ae26-3e4b61c970eb","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.858943Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:ed2e4db16653335a7cc987cbd92d55ea5239cda31d3474dc8fd5725b5a6b4bd1","observation_id":"45f5e9b4-6aea-412f-9781-7ea6f37df6f9","resolution":{"observed_at":"2026-08-08T13:29:11.555221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.534414Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"7644dc0f-32b8-457d-9b89-55d41a11df4b","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.863986Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:da39050f6c7477a233050ca07328ebdf96746082dfc967d7806866fc362e2fde","observation_id":"3ebf7b5d-0ca2-4611-99a3-a929bb3607b9","resolution":{"observed_at":"2026-08-08T13:29:11.539385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-09T04:25:12.977504Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-08T13:29:10.869139Z","title":"Rrhf: Rank responses to align language models with human feedback without tears","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.869139Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7dff943e308456184dbb49818cc38bfb1dc73685c880047f935d25ddc247ac27","observation_id":"0959e6bb-b69f-4519-b139-d1afefd35b8d","resolution":{"observed_at":"2026-08-08T13:29:10.869139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.518657Z","title":"Covid-19 pathophysiology: A review","venue":null,"work_id":"5a4b4ba5-ecd5-4c64-b773-ffd05a2894d5","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.874390Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:8dba5bb327f4950ebeff0ecae11e2431ddb352ef39bc44c7fa6da73ce2bab2af","observation_id":"910f057e-941d-4419-be53-bfbc0764eb8d","resolution":{"observed_at":"2026-08-08T13:29:11.523296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.502736Z","title":"Universal approach to de novo drug design for target proteins using deep reinforcement learning","venue":null,"work_id":"bde299fb-846b-4e27-9469-3c3ac7b24d6f","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.879206Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:17875ba55e93eebe49137c5492bfc652b679b111cc8a5266921b148beb8f4161","observation_id":"3e9b7808-5ea1-409d-92de-313d0a645cb9","resolution":{"observed_at":"2026-08-08T13:29:11.508183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.486403Z","title":"Optimization of molecules via deep reinforcement learning","venue":null,"work_id":"62821be3-4f27-44f4-9f1d-5a2ea2068e31","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.884009Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a411dc31af55a94759bed79c218634591f8070e7a7a394576928a8b37068c15c","observation_id":"eef72f93-4f95-40c2-8916-4eb13c4799fc","resolution":{"observed_at":"2026-08-08T13:29:11.491284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T13:29:10.888735Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.888735Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b4201994eeb7bbf431a1a8d62ba8cb14e95025f2535df8447d69086f75299bc8","observation_id":"b5fe6846-2656-4838-8bc3-70065bc8adff","resolution":{"observed_at":"2026-08-08T13:29:10.888735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:15:34.219033Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2502.07237."}