{"as_of":"2026-08-10T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88d4b8bef529f0e881b674b9694a3172eb181cfaaaab375e3397840008809b79","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T11:28:23.511747Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10474/citation-record","integrity":"/paper/2607.10474/integrity","json":"/paper/2607.10474/citation-record.json","paper":"/paper/2607.10474"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"American Mathematical Society, 2 edition, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3b23ee564a8f791f056a32b11001e479b706f470fbdb51c0d6476ea85ecebd6c","observation_id":"9c2a8297-13ac-4bdb-9160-cda16609d97a","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Cambridge university press, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:950b3540e35789f07e91d696f358cd0c45475893f0c2399fb6b6e406fae2f860","observation_id":"3e264e67-a8dc-4868-a8b1-2be3021a48ab","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Springer, 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:667a7b025ae75bb433115e379f24518114e5fb481757fe9c031b8ce932d72d78","observation_id":"36fc7b67-b486-4e7c-ac30-93b3ab78b628","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"SIAM, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:648abff0773a40249cb5fd754cc135ac79080105380ba37ce6e5b568664b38f3","observation_id":"a5a69d94-9d79-4082-a741-b832f8b37626","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"SIAM, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f3d32ef15786ef28b3a2246613e54797b1f6938ec634f43d6788ac15a287a3aa","observation_id":"115fd3ce-6941-4823-a23e-6b213aeb88f2","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3e0dffec5923756047964ffc96cae04833fd36b2ad588e0051d7492a0224faea","observation_id":"a1a414a4-0922-475a-ab4e-27c0163a690c","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Measuring coding challenge competence with apps.arXiv preprint arXiv:2105.09938, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ec00e53df5df2f4f588a576f19343b513ebfbdb6ce343af13ef361e260f0b75c","observation_id":"4b56acf4-4e06-4238-bcb4-8a5b77d36cda","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:653d74f8480d32572bae212a0962f0ce1d69dad915d6c068453df79a949351ff","observation_id":"37cda1a9-6b67-4a43-b293-550fd4b3bf9f","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Coderl: Mastering code generation through pretrained models and deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:54a4cdecce0f963d7eadab077c793a5ece4064f856a635d13889878d2fcf8c54","observation_id":"cdccca16-61e0-4fb2-a2cc-cb9f75ad6180","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Narasimhan, and Yuan Cao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:5dda6d5b2bc828c2038d8dc561029ee823dced9285dc4d7a4f90a536c9f6ced9","observation_id":"130a9fb1-6740-4829-bbfe-fd750d70b16c","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"URLhttps://openreview.net/forum?id=WE_vluYUL-X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:0c9843ff2237ed04722185c5c1739660f4dad6f5ec2bfa3e6f90cf7a8034d728","observation_id":"60040e24-02a3-4817-bac6-c7be406df154","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:4a358e2b0d845ea7862596e613803baeb1ceaf0b08810b57dbe5b92882c39789","observation_id":"dfd47062-a949-4b64-969c-22bb38ce2cf8","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Codepde: An inference framework for llm-driven PDE solver generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:0f137d1f25eed39a2a3e71bf7f6800cee9d1be4a966401ea72283ff583ef9452","observation_id":"af13fd51-764c-45c3-a680-4bcf05b56b9c","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09936","last_updated":"2025-09-12T02:53:57Z","snapshot_observed_at":"2026-07-06T22:29:06.119014Z","submitted_at":"2025-09-12T02:53:57Z","title":"SciML Agents: Write the Solver, Not the Solution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09936","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Sciml agents: Write the solver, not the solution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2509.09936","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:03b4be12f91f5f1b205336cb79ee9f490b3f3f224a63d8285c9fa6b6cf82571a","observation_id":"7606bdd5-7e76-4301-aae2-79bf3252bb7c","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Autonumerics: An autonomous, pde-agnostic multi-agent pipeline for scientific computing.arXiv preprint arXiv:2602.17607, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ff0de99d6ceb01060f4c224620dfa009e4c395022cdc7e167ed8d54eafc81341","observation_id":"d109cd36-cea3-4614-a1b6-1b172d6f578c","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"All-fem: Agentic large language models fine-tuned for finite element methods.Computer Methods in Applied Mechanics and Engineering, 457:118985, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:7335554298a8f49b75e46823d8819297061daad9e81ff8138743b3a575d4ef15","observation_id":"89b9b175-75c9-4af5-8740-28784aeef19d","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Pde-agent: A toolchain-augmented multi-agent framework for pde solving.arXiv preprint arXiv:2512.16214, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:6f82407b894d8295707eac30bf9dd2d30df250f4dccdfcff74e47ae73f8fcbba","observation_id":"01be39bb-1171-4877-ba82-54d12aebe090","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12053","last_updated":"2025-01-21T11:26:02Z","snapshot_observed_at":"2026-08-09T14:15:51.255382Z","submitted_at":"2025-01-21T11:26:02Z","title":"PINNsAgent: Automated PDE Surrogation with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12053","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Pinnsagent: Automated pde surrogation with large language models.arXiv preprint arXiv:2501.12053, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2501.12053","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:53d57ce8e600c8274225ee481c98f695db741d958da2062f9d510c53c8ebe1e2","observation_id":"fe4afabf-5ef0-477e-99b5-ba907efa9214","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:06da0ff16d92ec091e6e0e270e930a93341aae445264b953365edc72f81cd846","observation_id":"9df63f9d-7f74-4986-b992-8046fc8575f6","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models.arXiv preprint arXiv:2408.00724, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:2d686d41f32636a4ffeda634792dfb694d3088ef551c2e349ab250d26ddc3d37","observation_id":"54306c0d-dc39-4df0-b4bd-4263ab5ae388","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:abe90d9a446deb256d33b448ad6d2978d8082ca59719e807c01f644045cc9a82","observation_id":"624f6a03-86d6-4a14-a9db-71e2c052226b","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f86ea8dcd46320be7a80b3cc789e8722865ecb5c62df40c37f8922c312ecf062","observation_id":"5bbf41bc-d83b-479f-bdd8-71f5097d3cdf","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:306b44e2c0c4a7d95b252d575282fa80be1eef50b107223e7064844932204bbd","observation_id":"39fc4ebd-d77d-44b6-adb1-6c1a7d4acaf5","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:be82f6024324e22625c7dae4ea8536c55240da821804e7f9fe4e03b6f00d1d7b","observation_id":"4d811320-eb90-4cd9-a7f8-44200d21492a","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:0aab157fcded7f6c98214120bfc43f188d449f80d9cfa6564bea9008ddbbd51f","observation_id":"e84096b0-83c2-4f0e-b77c-6b7afe6c34e1","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Huerta, and Hao Peng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:7c52d649cb0f1ac26c5eefebff5809d2d116312c3936cad11b70e2e3c33fd0b9","observation_id":"45d4cca4-fa63-48b2-bc1a-8874f9d0d396","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Foam-agent: Towards automated intelligent cfd workflows.arXiv preprint arXiv:2505.04997, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ae0c701f9455ceea80a568e5e07a24be9bddec831aa443a75e8001c410c3bedd","observation_id":"0275feb3-b127-4e03-bd36-874c45a4be81","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Openfoamgpt: A retrieval-augmented large language model (llm) agent for openfoam-based computational fluid dynamics.Physics of Fluids, 37(3), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:acf8ce3d427a6f9732aa0452b552e3088102e10402c223af76c80862be8c195e","observation_id":"a85e05d4-686d-4fb3-8def-9ed2414b218d","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21320","last_updated":"2024-08-07T04:34:11Z","snapshot_observed_at":"2026-07-06T18:54:49.923926Z","submitted_at":"2024-07-31T04:01:08Z","title":"MetaOpenFOAM: an LLM-based multi-agent framework for CFD","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21320","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Metaopenfoam: an llm-based multi-agent framework for cfd.arXiv preprint arXiv:2407.21320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2407.21320","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:9cb7762ddd6b43ae6a47db14aa76a4f60b10da62dedda07979d35acbfa994e2d","observation_id":"1a55b5cc-3704-4caf-94bd-18814d579698","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Mooseagent: A llm based multi-agent framework for automating moose simulation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:01c6cac65ffb0416c8ae63affe0a8cba52a9328666ae665787ebd77e44cd1372","observation_id":"2d340ce7-621f-481a-968c-f15309f5d76b","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11044-026-10152-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chronollm: customizing language models for physics-based simulation code generation.Multibody System Dynamics, Feb 2026","venue":"Multibody System Dynamics","work_id":"d61d39db-a9c0-488b-b44a-1b1f7cde178f","year":2026},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:33c2bfd88692ab47dc0c89733b305fc45f9539849e7adc91e39653d84413c532","observation_id":"e38baeff-07f0-4af1-800e-ec6d11f182e2","resolution":{"observed_at":"2026-07-14T11:30:25.748518Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:41.409892+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:41.409892+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Lang- pinn: From language to physics-informed neural networks via a multi-agent framework.arXiv preprint arXiv:2510.05158, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:b0630f8723fee0336a5fffb37c2a66614bf8d42087563ec337ce05b459cf61a5","observation_id":"913d1ec4-cdfa-4feb-a229-e36b065e6a8d","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06260","last_updated":"2025-04-08T17:59:39Z","snapshot_observed_at":"2026-08-07T16:07:25.844827Z","submitted_at":"2025-04-08T17:59:39Z","title":"FEABench: Evaluating Language Models on Multiphysics Reasoning Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06260","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Feabench: Evaluating language models on multiphysics reasoning ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2504.06260","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ca3f0805c04f979e41d8ab77c953722087c215c2c98f599ae8e5cfb937e8e9ac","observation_id":"fbfc218b-0463-4530-b5e1-d51e4e59d3fd","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11805","last_updated":"2026-04-13T17:59:40Z","snapshot_observed_at":"2026-08-02T15:15:02.363794Z","submitted_at":"2026-04-13T17:59:40Z","title":"Solving Physics Olympiad via Reinforcement Learning on Physics Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11805","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Solving physics olympiad via reinforce- ment learning on physics simulators.arXiv preprint arXiv:2604.11805, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2604.11805","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:870d7fc1a3c443250a70cb31f0e9cfce20449012741e5449a682af644d2b1cca","observation_id":"72c4e00f-6067-4c45-a5a7-e4c55ce47623","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00963","last_updated":"2025-06-11T03:07:41Z","snapshot_observed_at":"2026-08-09T17:02:43.420552Z","submitted_at":"2025-02-03T00:03:41Z","title":"PDE-Controller: LLMs for Autoformalization and Reasoning of PDEs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00963","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Pde- controller: Llms for autoformalization and reasoning of pdes.arXiv preprint arXiv:2502.00963, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2502.00963","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ad9b1ce51153470bec5bd79cc4ec02a194ea5c4731efc66c5a11a21598c1df01","observation_id":"1359ee21-87e0-4e85-985e-3ec70721d6e9","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Agentic scientific simulation: Execution-grounded model construction and reconstruction.arXiv preprint arXiv:2603.00214, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:18061f6e863cf4ed4c4fffd4e082b737061ca04c64c7f9f14ae36d689c0dc6d3","observation_id":"3da208fc-ebdd-4c99-9584-79ae27d54505","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:c67d2c08e37113564ea04bff929f8658fbbfc26ca5ed56c2f39640489b6856cd","observation_id":"84a015bf-0af4-44d6-80c1-f7c88b8bed10","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Group sequence policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f34d04500a962e8a61bf3984bcd93632fa2727b7ce1d6760ed536db3846677ee","observation_id":"52864811-cc87-4474-adc2-93ba935dfba9","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Stepcoder: improving code generation with reinforcement learning from compiler feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:c454768d9cffd49ff49b964ce0d7e69b92cc5e76d01b32edecf4da7cccfac60c","observation_id":"41ec3765-e6e3-48e6-b353-8aff44293cc7","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-09T08:19:47.205759Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Reinforcement learning for machine learning engineering agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3e180d0609054d2e024f47c4aa1bd9dc8572e64743e9a2c10c2b3f650f2162d8","observation_id":"082a7f23-a38a-4140-b7dd-43e98d831d0b","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-08-07T06:17:41.140558Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Beyond binary rewards: Training lms to reason about their uncertainty.arXiv preprint arXiv:2507.16806, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:d444ee7ad409615532ee16fe41b4c0b644daf8204617bd6c19444ea5207b615b","observation_id":"f70029e2-a09f-404e-afdb-cc00f2c50e31","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:80242a8b9db02d259431b25d44df651eb4ef5746b54cfae400a88f158da3833d","observation_id":"4952e689-6e5e-454c-88ea-06e30e533702","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08895","last_updated":"2021-05-17T03:12:33Z","snapshot_observed_at":"2026-07-06T10:05:26.653366Z","submitted_at":"2020-10-18T00:34:21Z","title":"Fourier Neural Operator for Parametric Partial Differential Equations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08895","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Fourier neural operator for parametric partial differen- tial equations.arXiv preprint arXiv:2010.08895, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2010.08895","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:458c3f25cb9fd25b7d37395ebbd2c822fcdcffc9f5d68eca660c0e59031b42ce","observation_id":"1ec75db1-7a38-471b-b941-8b0b4239a2a6","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Learning nonlinear operators via deeponet based on the universal approximation theorem of operators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:63093609fbd93cf52d186968d91ea17edd82e8ed8822fae7d1e8a89e3615bdbd","observation_id":"875278d0-a8fd-4ea5-ac02-187f5fd731bf","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Towards long rollout of neural operators with local attention and flow matching-inspired correction: An example in frontal polymerization pdes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3e21a460ad0caff6b8e33115d66c6bd89a1e7ce63f19aba8174fad49262795dd","observation_id":"3a8f95d5-ad38-4ff7-b096-65755577ef78","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Pdebench: An extensive benchmark for scientific machine learning.Advances in neural information processing systems, 35:1596–1611, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:17eb16c2a67b18bffb464ed7783746eee99957968f6d989fea1f785f43373b7a","observation_id":"18612c69-901d-48da-853e-be40c0411fc6","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Diffusionpde: Generative pde-solving under partial observation.Advances in Neural Information Processing Systems, 37: 130291–130323, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:11ddee6963f958a26a128a79a702298f0d46925d454881d4c208b614f20eb255","observation_id":"c1e53791-f6a6-4825-9da6-01720d5d4ae0","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14404","last_updated":"2025-03-13T08:07:40Z","snapshot_observed_at":"2026-08-09T04:34:11.308455Z","submitted_at":"2024-03-21T13:52:55Z","title":"Physics-Informed Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14404","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Kochmann","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2403.14404","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:494ccebb2894974eab7ee6c2380afffcc4f7992c2feded70080f494d2efa6ff2","observation_id":"546f6ddc-d397-4231-b52c-47b2f65662d5","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Physics-constrained flow matching: Sampling generative models with hard constraints.arXiv preprint arXiv:2506.04171, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ec444f509c42aaee524f17076281e5b952f872f8a6e675a763850051c6362b5b","observation_id":"0e93baef-bf6f-4707-b999-08b1e1e67819","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"End-to-end probabilistic framework for learning with hard constraints.arXiv preprint arXiv:2506.07003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:747553bdfb076ac43eeb1fde380aa54d0323514b57a5c6a74355988884a5516a","observation_id":"a1478eb7-a62d-4f7d-bbaf-00b1f33f3939","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:af608dc3fd48c7852928204e3e083eb21db133d5557078976b750ecf4874123c","observation_id":"c106f845-3b5f-4fe6-b0d8-551656f32fbe","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Qwen2.5-Coder technical report.arXiv preprint arXiv:2409.12186, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:b1fb641e1459a417c709dee58edefe81e604e5cfe260554cf1f57532c0e2985e","observation_id":"62d554c6-900f-468b-9109-ef3307a28e3b","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:9faaa4a54e42d3e0ac368cc400da67f2e0805f43c83848d75a2003b14620a3c4","observation_id":"25401330-e3f5-4936-804f-83b9a6ad3b99","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"A model for fast computer simulation of waves in excitable media.Physica D: Nonlinear Phenomena, 49(1-2):61–70, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:2bd649394c7c82b8a5aefdec40d4a64fa4b01081f180ee86d00f346ff0c13011","observation_id":"18f47ed7-4f88-4f12-8d82-8395aff5f1f8","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Finite difference method for numerical computation of discontinuous solutions of the equations of fluid dynamics.Matematiˇ ceskij sbornik, 47(3): 271–306, 1959","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3df7819dcc8ae64060343390406483d1dcb0d2434f96e7e2a580decdc80f7e2b","observation_id":"29a80986-4a9a-47be-8f06-bdae568ae946","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Towards the ultimate conservative difference scheme","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3febef61f0c471c9353747116cc6ae71e166e9d3d51ccca8134053d805cc7e32","observation_id":"262ef592-3736-4460-b7eb-b996676d64bf","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"New high-resolution central schemes for nonlinear conservation laws and convection–diffusion equations.Journal of computational physics, 160 (1):241–282, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f2da83b9567810c624b03d27eb7562a77034182a11de5cd56d23665871b5f33d","observation_id":"b70b2f42-e862-4aeb-bc88-0fb87d62d5af","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Toro.Riemann Solvers and Numerical Methods for Fluid Dynamics","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:133a08854e1ae618df4503d22907e2d38d0b62e92d7bb01b5eb6111a8704af02","observation_id":"edc2e5e0-c850-4b61-8191-2e4d0b06feda","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Strong stability-preserving high-order time discretization methods.SIAM review, 43(1):89–112, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:5fa6878bfd87905500bc5101221540dbff3cdfb855106dc77b60cad106c03d6b","observation_id":"47019da4-0458-4c15-9f9a-eb857fe302e9","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"On the construction and comparison of difference schemes.SIAM journal on numerical analysis, 5(3):506–517, 1968","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:96df786251ff4eda4162a968935d4480ff06c666fee699103e83d2c8798eb0c6","observation_id":"8a4015b7-9d4c-4cd6-b243-f6e25b2ba310","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Implicit-explicit runge-kutta methods for time-dependent partial differential equations.Applied Numerical Mathematics, 25(2-3): 151–167, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:349c132aa224e4fddd48dd34d0626166d9ba10f1f261ce6e902e893f6c43d4c2","observation_id":"a52ddfc9-a4ff-4487-b268-7fc131ab12d8","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Fourth-order time-stepping for stiff pdes.SIAM Journal on Scientific Computing, 26(4):1214–1233, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f2b70a43c7b3452d635ca7930ae69c91f071e1a70c61627a897226980ad7e7f7","observation_id":"468f879b-6e28-49e1-811b-476cd6f91fd3","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1090/s0002-9904-1967-11853-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The numerical solution of the Navier–Stokes equations for an incom- pressible fluid.Bulletin of the American Mathematical Society, 73(6):928–931, 1967","venue":"Bulletin of the American Mathematical Society","work_id":"592eecb5-ee62-42da-b52a-b5bf29dbfacc","year":1967},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:48e6fdeebb25d8bb85318f0be26e78d34b0b6f011849e74e6cbf440b55a75a95","observation_id":"a0eeb148-5fcc-417f-8072-fb4fafdb1ba3","resolution":{"observed_at":"2026-07-14T11:30:25.737831Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:42.185565+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:42.185565+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Wellesley-Cambridge Press, 1986","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:d026403410a4e6e35da12f500b5096e1695c47798b1f61da04b0d092dac23620","observation_id":"c68f4517-646a-46cd-b18f-0f38ebd31974","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Scipy 1.0: fundamental algorithms for scientific computing in python.Nature methods, 17(3):261–272, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:2788cb39c32a5a0ab8890982781469cf61702ae7b223012efbfa0e45444a164a","observation_id":"4c58c301-050a-439f-a395-ad8ceb47c94f","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"On the elimination of aliasing in finite-difference schemes by filtering high-wavenumber components.Journal of Atmospheric Sciences, 28(6):1074–1074, 1971","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f31fb49d836ce9c95c59abc4f5d6eadd71116463ae17653ea2941b1f8b71929d","observation_id":"ffb451eb-eecf-46eb-b60e-701e506d4255","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Semi-lagrangian integration schemes for atmospheric models—a review.Monthly weather review, 119(9):2206–2223, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:98f9871b58bec049a91fc2828b99344f8d025f6a9121986728af440f69f1aca7","observation_id":"68bbd1b8-127d-4493-8bbb-b0d3b0c5a434","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"SIAM, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:7a879c1f6558225ec98f612bf27ec99ca86fa3dc9b66ebfb9eb8df19af4f66cc","observation_id":"4458a449-2ca6-4396-9a45-40c8850cd024","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"The calculation of the interaction of non-stationary shock waves and obstacles.USSR Computational Mathematics and Mathematical Physics, 1(2):304–320, 1962","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:2e0bb3522807db5e0166625bc5cd536f5f9fcd03c1ec32919cce952915e03b45","observation_id":"cccf25a3-36ab-4c17-9633-25e48b97dfd3","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Systems of conservation laws.Communications on Pure and Applied Mathematics, 13:217–237, 1960","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:9313a94bd5266a0e3344b19b70a79864074f91035c12ee1cebc5e73ae0e72a9c","observation_id":"2826c273-9ea2-42ed-b809-f5e36decb625","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"The effect of viscosity in hypervelocity impact cratering.Journal of spacecraft and rockets, 40(5):757–763, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:28335f79d7f1ea495806d5bdccf957665b3e50e98ee8ef84414ff6520212291c","observation_id":"f3bceee2-ffed-4c61-98dc-29d9215b16fb","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Springer, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:d3451416f1801340617d23829d1ad67b29603e7f9aa4c4db375b3e4aaa44557d","observation_id":"df339ee1-c52c-457b-bd41-89605c43c313","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Finite volume methods.Handbook of numerical analysis, 7:713–1018, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:b647eb52cae679ba3992dc13d48b8172e895ad93c90d15390e9e855a9183f66d","observation_id":"d93d8694-048c-474b-b93d-9c9e2cdedd53","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Methods of conjugate gradients for solving linear systems.Journal of research of the National Bureau of Standards, 49(6):409–436, 1952","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:fa67c938050728316ccfbe89db2bc992e696abb012c5e8b3df3d6caf2fd7db0f","observation_id":"cdda3a8f-19cc-4c8d-b1da-891fd4a6ac2e","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"SIAM, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:9023728e829090700b584e4c4f45f5406aa3751eb676db4f8cb32b00db41930a","observation_id":"ef4648b6-41a3-46da-8d2e-b9292b759f08","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Springer, 4 edition, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:e24b08870fe1b2db3263d0135f3a9e5f1e145d50bccf7bda7c196572a8da15b4","observation_id":"f246ce2d-75ae-44a4-b0d5-9da9de767a50","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Approximate riemann solvers, parameter vectors, and difference schemes.Journal of computational physics, 43(2):357–372, 1981","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:a50ccc64514364985e2ee27b965cc4511d81f773d0a967583caff7d974404c19","observation_id":"3ae2cb35-29a7-43c5-9805-e18c08913990","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Information theory and statistical mechanics.Physical review, 106(4):620, 1957","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:f7bd8c5c55c3bcaa510b6a0d1e9a67067c205cfa70c7fdfd0306726c6659d806","observation_id":"eb47f0e1-c1c6-4c64-b552-c5e5c29897be","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Academic Press, 11 edition, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:590e85b6bb4edaa48196f540181f023314c93d45f3aa1e57e47638bdc30c41a8","observation_id":"48dbb034-9c96-4bb9-b7f8-c22117313ee6","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Equation of state calculations by fast computing machines.The journal of chemical physics, 21(6):1087–1092, 1953","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:85e16cefee76c9e30e15115f14281f5afec97f4db9789b6f01776e0675382e1a","observation_id":"55b2cfab-85c7-4f2e-ac09-efe89111e1e0","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Ziebart, Andrew Maas, J","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:43fe79fbaf9cee25d284950795645da2b6bc9ce2cfff3130efa4ab14c44964fe","observation_id":"8877ab60-e240-4a88-82e8-1fbcb8052472","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:2ac78005ed05a5b2239d8cfa2c376aed83b5e4e7ea0ecede735be99ea2444964","observation_id":"8cf82fa4-923f-4b76-b026-9384fe8b1903","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Where applicable, we additionally require that solvers within a scheme family agree on smooth initial data to within their formal order at fixed resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:c8e57791a61878907d82da32b1e8440db264c0fcf6827de0bc8ced3ac7614124","observation_id":"6d26fc3b-1ddb-4815-8dc5-f8858144caac","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"This producesabsoluteerror against the exact ue at each grid level rather than a self-consistency ratio, and detects sign errors and stencil bugs that self- convergence cannot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:95e22688fff303125510b832c7df159972061e9cd066dd1d4b4981b905e205a4","observation_id":"499fcfd1-cbfd-4bbf-99c1-f1e06c0457ae","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"This provides a check against an independent benchmark, complementing self-convergence and MMS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:10a6f3ec14952767b04b2c6b5ddce6d003b57875413fed253ff672ab592d08a8","observation_id":"c849d7e5-efa8-43c8-9412-8a447c9a0809","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:09:54.543218Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2607.10474."}