{"as_of":"2026-08-21T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7679d66063f61068dc63e13aa6272f6949addc35ece3c93e765388024db4543c","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:41:46.847782Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T09:34:09.347912Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T11:28:04.326064Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"cited_work":{"arxiv_id":"2602.12984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12984","snapshot_observed_at":"2026-07-03T11:28:04.326064Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","venue":"cs.CL","work_id":"b00b8c23-7ade-468b-af1f-734876ade236","year":2026},"citing_paper":{"arxiv_id":"2604.18805","last_updated":"2026-04-20T20:23:42Z","snapshot_observed_at":"2026-08-11T12:30:36.819624Z","submitted_at":"2026-04-20T20:23:42Z","title":"AI scientists produce results without reasoning scientifically","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T03:56:34.581133Z"},"links":{"cited_paper":"/paper/2602.12984","citing_paper":"/paper/2604.18805"},"observation_digest":"sha256:ba2c3063989736ac6a67f1188079823db323511f918234ede879604dfb69a1c9","observation_id":"34e2cafd-a6ce-4171-a250-d665cac90c96","resolution":{"observed_at":"2026-06-02T02:03:38.947361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"cited_work":{"arxiv_id":"2602.12984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12984","snapshot_observed_at":"2026-07-03T11:28:04.326064Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","venue":"cs.CL","work_id":"b00b8c23-7ade-468b-af1f-734876ade236","year":2026},"citing_paper":{"arxiv_id":"2606.12736","last_updated":"2026-06-10T22:55:30Z","snapshot_observed_at":"2026-08-13T06:23:01.820831Z","submitted_at":"2026-06-10T22:55:30Z","title":"Benchmarking AI Agents for Addressing Scientific Challenges Across Scales","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T09:34:09.347912Z"},"links":{"cited_paper":"/paper/2602.12984","citing_paper":"/paper/2606.12736"},"observation_digest":"sha256:b2fc7fe53e2ecd276a4c0af3675b69b49eb2f4981053be38d3cb5793cbe01acb","observation_id":"4a5d332b-b3ee-410f-93d2-9b9884877e8d","resolution":{"observed_at":"2026-07-03T11:28:04.327347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.12984/citation-record","integrity":"/paper/2602.12984/integrity","json":"/paper/2602.12984/citation-record.json","paper":"/paper/2602.12984"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-02T23:41:41.542179Z","title":"On evaluation of embodied navigation agents.arXiv preprint arXiv:1807.06757, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:41.542179Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:06cd46520606eb23be100f0682884393677ec70291ca91014fce1ee693e6097b","observation_id":"74473242-8dee-46df-bf85-2a44e35342cf","resolution":{"observed_at":"2026-08-02T23:41:41.542179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:41.626293Z","title":"System card: Claude opus 4 & claude sonnet 4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:41.626293Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:423a7e5032d0b286aeb3af36b8d44b3256cc098f066168dbbb4294be2eff05b3","observation_id":"950e1056-e214-47dd-8521-8f0845cb7eff","resolution":{"observed_at":"2026-08-02T23:41:41.626293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:41.760033Z","title":"Claude sonnet 4.5 system card.https://www.anthropic.com/claude-sonne t-4-5-system-card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:41.760033Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:a14e1c842a3bc00b300de59fb4287d19c9987823daea15a7f250c53c27a5143a","observation_id":"dc4b5753-9acd-4630-802b-d7c3fcf6e0a1","resolution":{"observed_at":"2026-08-02T23:41:41.760033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05241","last_updated":"2025-07-08T15:54:19Z","snapshot_observed_at":"2026-08-14T22:05:38.020325Z","submitted_at":"2025-07-07T17:50:52Z","title":"SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05241","snapshot_observed_at":"2026-08-02T23:41:41.833775Z","title":"Scimaster: Towards general-purpose scientific AI agents, part i","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:41.833775Z"},"links":{"cited_paper":"/paper/2507.05241","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:0f67204d0051287865b5dfce39d8ffb109eaab25d5eeea8b2577603c4a89d1d9","observation_id":"3e40eec4-fa03-4bb0-bf45-28bb5653ea85","resolution":{"observed_at":"2026-08-02T23:41:41.833775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T23:41:41.937664Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.CoRR, abs/2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:41.937664Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:0403d39beb836a6c555a2c1f2f179903578f7995b5cabb516c9d9ee78dda4d9d","observation_id":"4e29a8cc-7b09-435b-94b2-a796665c3b17","resolution":{"observed_at":"2026-08-02T23:41:41.937664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-08-15T17:40:05.031382Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-02T23:41:42.011986Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines.arXiv preprint arXiv:2502.14739, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.011986Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:347fd109fcbd0314347080c86f7f7fe88b282f983fb2f193bc28b3daf2de3024","observation_id":"3dc69148-fa01-465f-bef5-f6d5a7a2240b","resolution":{"observed_at":"2026-08-02T23:41:42.011986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16770","last_updated":"2025-05-23T15:40:22Z","snapshot_observed_at":"2026-08-16T19:48:07.566842Z","submitted_at":"2025-05-22T15:11:57Z","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16770","snapshot_observed_at":"2026-08-02T23:41:42.127992Z","title":"Rbench-v: A primary assessment for visual reasoning models with multi-modal outputs.arXiv preprint arXiv:2505.16770, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.127992Z"},"links":{"cited_paper":"/paper/2505.16770","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:93500b928b4bf81dd042ca8b314db567963b534b51d31da4fe648dd338b413a8","observation_id":"1ca25276-d045-401e-a83c-c106fa18b3ee","resolution":{"observed_at":"2026-08-02T23:41:42.127992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-19T05:43:25.096121Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T23:41:42.234154Z","title":"R-bench: Graduate-level multi- disciplinarybenchmarksforLLM&MLLMcomplexreasoningevaluation.CoRR,abs/2505.02018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.234154Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:2314be2bd195239e6145c30aac99ab98faed54d41eea957a4a4eb00e319b4feb","observation_id":"b0663a81-39ac-4ee8-b7e8-d3f351d37055","resolution":{"observed_at":"2026-08-02T23:41:42.234154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:42.555326Z","title":"Discoveryworld: A virtual environ- ment for developing and evaluating automated scientific discovery agents.Advances in Neural Information Processing Systems, 37:10088–10116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.555326Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:41d9cb666791ebe2a6cee173680e54b9e780c62dd7143aea6973e4852f269546","observation_id":"4976358a-5bc9-445a-bfb7-55cb644d8af7","resolution":{"observed_at":"2026-08-02T23:41:42.555326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-19T05:43:25.096121Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T23:41:42.420473Z","title":"URLhttps://doi.org/10.48550/arXiv.250 5.02018","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.420473Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:b6e0195c5d0a73434102fa51ed740b7eee8f4660557d4f095a84b9f65b9c9903","observation_id":"a84e9cb5-7ffb-4bf3-afd3-a6f9e5cf63c3","resolution":{"observed_at":"2026-08-02T23:41:42.420473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-20T10:21:12.032735Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-02T23:41:42.810611Z","title":"Agentbench: Evaluating llms as agents.arXiv preprint arXiv:2308.03688, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.810611Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:eb770dfaff39f71671858d1e5da8e1742d2240f2c34b103d026f42a16cc5503a","observation_id":"2188affb-e4be-4da2-934d-62c4c193b34b","resolution":{"observed_at":"2026-08-02T23:41:42.810611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-08-15T17:19:59.096854Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-02T23:41:42.720642Z","title":"Search-o1: Agentic search-enhanced large reasoning models.arXiv preprint arXiv:2501.05366, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.720642Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:9032f02c32b1b4c0397b174726b7e5ae09e2110706e1b6716f6150388df3d058","observation_id":"03a0ca64-dbeb-45e7-b0fd-21cb65174b20","resolution":{"observed_at":"2026-08-02T23:41:42.720642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11451","last_updated":"2024-02-21T03:04:49Z","snapshot_observed_at":"2026-08-17T18:01:28.589125Z","submitted_at":"2024-02-18T04:19:44Z","title":"SciAgent: Tool-augmented Language Models for Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11451","snapshot_observed_at":"2026-08-02T23:41:43.110460Z","title":"Sciagent: Tool-augmented language models for scientific reasoning.arXiv preprint arXiv:2402.11451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.110460Z"},"links":{"cited_paper":"/paper/2402.11451","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:9b49d767c92078868715b9419f717517c723f163edb02142ff8b3b1290329c1d","observation_id":"2adc9e63-4b74-4682-9bcc-435936b1d7d0","resolution":{"observed_at":"2026-08-02T23:41:43.110460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:42.972355Z","title":"Learn to explain: Multimodal reasoning via thought chains for sciencequestionanswering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:42.972355Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:19e284c7e4ac43ea6e7f16070fee9c05add8cd8bdb4e22e50a1bde9561c2b998","observation_id":"e2644418-bd9b-4aeb-916e-a46e51f3f435","resolution":{"observed_at":"2026-08-02T23:41:42.972355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:43.489952Z","title":"Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.489952Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:059ce1c615b3086df10c9518d54af00594e04d524ef6e65efc1024fa2a8e5be6","observation_id":"9df05970-bd16-4978-bedd-dafad7ef3e9d","resolution":{"observed_at":"2026-08-02T23:41:43.489952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T23:41:43.244893Z","title":"GPT-4 technical report.CoRR, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.244893Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:91c49b7cadca31955b65cfe5adf4047fa1dad49473e208f6a39a6f48a28aba6a","observation_id":"4c320aa6-47e9-46bd-84c8-a3e4cfb63e72","resolution":{"observed_at":"2026-08-02T23:41:43.244893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-02T23:41:43.849352Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.849352Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:df0de341bf1eaa2abad766e555455c5f7d38c36770ab7789fe0d7259f498e307","observation_id":"9d12ad95-afbf-4ad3-8b9d-dc75de34e558","resolution":{"observed_at":"2026-08-02T23:41:43.849352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T23:41:43.964010Z","title":"Openai gpt-5 system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.964010Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:61a97d1b58496833c2ba0a50ecfc6a7b2b06c9e957925274bb01793442264edc","observation_id":"13636209-cf9b-4ac8-aa01-4d39739d02c0","resolution":{"observed_at":"2026-08-02T23:41:43.964010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-02T23:41:43.668704Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis.arXiv preprint arXiv:2307.16789, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.668704Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:cc8a5e36b7ecfbe4276036de201c1a95a9301dcaffe814483b14c8d50d826002","observation_id":"8b829228-cf1d-4d46-8ee0-fac425ef68e2","resolution":{"observed_at":"2026-08-02T23:41:43.668704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20743","last_updated":"2025-06-25T18:10:30Z","snapshot_observed_at":"2026-08-14T20:38:44.002322Z","submitted_at":"2025-06-25T18:10:30Z","title":"A Survey of AI for Materials Science: Foundation Models, LLM Agents, Datasets, and Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20743","snapshot_observed_at":"2026-08-02T23:41:44.325186Z","title":"A survey of AI for materials science: Foundation models, LLM agents, datasets, and tools.CoRR, abs/2506.20743, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.325186Z"},"links":{"cited_paper":"/paper/2506.20743","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:dbacc1b9aeba45126ac839033b16f5901b87b9b272df7b6092ad91a04a9cb66c","observation_id":"51aa645c-fae6-4fa5-a76c-97b7b2b589f8","resolution":{"observed_at":"2026-08-02T23:41:44.325186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10121","last_updated":"2019-07-23T20:31:36Z","snapshot_observed_at":"2026-08-04T12:48:10.448438Z","submitted_at":"2019-07-23T20:31:36Z","title":"SciPy 1.0--Fundamental Algorithms for Scientific Computing in Python","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10121","snapshot_observed_at":"2026-08-02T23:41:44.466323Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Courna- peau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, Stéfan van der Walt, Matthew Brett, Joshua Wilson, K","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.466323Z"},"links":{"cited_paper":"/paper/1907.10121","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:98eb654bd32ea2ba6f4111dffa367aa4dca0e16a6a8e1d4cbee0f3536dec32b6","observation_id":"822f1f30-8980-4930-92de-533dc8e382ca","resolution":{"observed_at":"2026-08-02T23:41:44.466323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T23:41:44.143270Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.143270Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:d307416a4c54df536a8b449093421881b371133370d521806068ca5a7ecd8a8e","observation_id":"06f3a84d-5ff8-4037-8741-988b642024a5","resolution":{"observed_at":"2026-08-02T23:41:44.143270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:44.760711Z","title":"From AI for science to agentic science: A survey on autonomous scientific discovery.CoRR, abs/2508.14111, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.760711Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:0744dd2bf0c7bdc3c6c9f6aed8d2c477190eee9ed3d4b33cf351d42ab7784027","observation_id":"5da8c59e-ac14-4cad-88ec-70bf662a7fb7","resolution":{"observed_at":"2026-08-02T23:41:44.760711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:44.879166Z","title":"AgentGym: Evaluating and training large language model-based agents across diverse environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.879166Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:d31e40b42205478f044acb7f251df931637f77e407f5b5b15f08aec081847e42","observation_id":"e2328cb1-f3cd-4bd8-88e7-2a7dd8f8ff5f","resolution":{"observed_at":"2026-08-02T23:41:44.879166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-02T23:41:44.622336Z","title":"Loomba, Shichang Zhang, Yizhou Sun, and Wei Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.622336Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:f88da8ca05f5078082710b3a65165711177ae5f8599012cb6c27b4bffcf27281","observation_id":"18793b37-a88c-4d30-aeee-1d82db5fb1e6","resolution":{"observed_at":"2026-08-02T23:41:44.622336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-16T04:37:38.377850Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-08-02T23:41:45.067017Z","title":"BMMR: A large-scale bilingual multimodal multi-discipline reasoning dataset.CoRR, abs/2507.03483, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.067017Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:b7eda4f1a21966d054428c14204963a8a9401de5943bb1dbf888e4339e076b12","observation_id":"043f1a4b-b753-4a0b-9e06-afe4d804ee16","resolution":{"observed_at":"2026-08-02T23:41:45.067017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16504","last_updated":"2023-05-25T22:10:20Z","snapshot_observed_at":"2026-08-16T15:29:32.108538Z","submitted_at":"2023-05-25T22:10:20Z","title":"On the Tool Manipulation Capability of Open-source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16504","snapshot_observed_at":"2026-08-02T23:41:45.208041Z","title":"On the tool manipulation capability of open-source large language models.CoRR, abs/2305.16504, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.208041Z"},"links":{"cited_paper":"/paper/2305.16504","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:fa33f95bd035205956063b71f180226443a3b16ba8935b2c40e81341a6ecdd2e","observation_id":"dd321c8a-80c4-48f9-8e85-7e8113c85983","resolution":{"observed_at":"2026-08-02T23:41:45.208041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-15T23:25:21.613036Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T23:41:44.971735Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.971735Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:8f40c476dea0ea0cf31c252fae068810bfe7b1273c14837c9b2e890dca2705ef","observation_id":"521c8bd2-31d2-4ddf-bc5f-0bfa840077e2","resolution":{"observed_at":"2026-08-02T23:41:44.971735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T23:41:45.360064Z","title":"Qwen3 technical report.CoRR, abs/2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.360064Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:5972112fb4e7ef14d96d8e2d749ce420afcffc7005eb8ab143600abc8d871277","observation_id":"2ac982ff-d9a9-42a2-b187-1956894abcec","resolution":{"observed_at":"2026-08-02T23:41:45.360064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-02T23:41:45.410108Z","title":"React: Synergizing reasoning and acting in language models.CoRR, abs/2210.03629, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.410108Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:d9d807de3e86df8237527506705a551981874784dffb64fc6299c9c416d01b63","observation_id":"f315465b-7099-4a1d-8722-cbb6ef739bb4","resolution":{"observed_at":"2026-08-02T23:41:45.410108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:45.299746Z","title":"Wang, Peifeng Ruan, Donghan Yang, Tao Wang, Guanghua Xiao, Xin Liu, Carl Yang, Yang Xie, and Wenqi Shi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.299746Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:f677d0701c64cfc8ce33094d43d96e41c16dc4b756ab2c978626c770739b7090","observation_id":"1ad184a2-420a-4a78-be22-8aa42cfb9da2","resolution":{"observed_at":"2026-08-02T23:41:45.299746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21557","last_updated":"2025-03-27T14:43:28Z","snapshot_observed_at":"2026-08-18T10:18:48.714600Z","submitted_at":"2025-03-27T14:43:28Z","title":"debug-gym: A Text-Based Environment for Interactive Debugging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21557","snapshot_observed_at":"2026-08-02T23:41:45.552764Z","title":"debug-gym: A text-based environment for interactive debugging.arXiv preprint arXiv:2503.21557, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.552764Z"},"links":{"cited_paper":"/paper/2503.21557","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:2647aa9f4aabe1236fadd6de4e659d40b49fa83ad87cb403551024bb3c992ed0","observation_id":"a366daec-3d43-43b2-a6f9-54bebbd1f34a","resolution":{"observed_at":"2026-08-02T23:41:45.552764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-08-20T22:20:11.069630Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-02T23:41:45.646682Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark.CoRR, abs/2409.02813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.646682Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:f64e58f8d8cb17b9cf88b423de93f87c2c11d79d6ab8a33ed8457c96e19026ea","observation_id":"3022e7e4-6289-4b75-b337-7e9140606382","resolution":{"observed_at":"2026-08-02T23:41:45.646682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:45.464222Z","title":"URLhttps://arxiv.org/abs/24 06.12045","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.464222Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:67973047a0504d6ab93d4ff66c6d39d9b709152af68bfb0d52e39b29c1c9f1d5","observation_id":"7a2a993a-c2e0-4d3b-825b-f272da28d61e","resolution":{"observed_at":"2026-08-02T23:41:45.464222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:45.806856Z","title":"Sciinstruct: a self-reflective instruction annotated dataset for training scientific language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.806856Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:40b9b8835172023e8df4d3229156bb6515b2d7f5eb6830432029ec09731a3b2f","observation_id":"20337007-c0ef-4811-a432-d37b4836ab93","resolution":{"observed_at":"2026-08-02T23:41:45.806856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T23:41:45.930272Z","title":"The landscape of agentic reinforcement learning for llms: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.930272Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:69ffb0741d1232b7b55a8149b2c2786a94dd6d39186cf59c284356ef5a9e1e07","observation_id":"a3a7ae48-876a-4096-9503-ade0391bc9f1","resolution":{"observed_at":"2026-08-02T23:41:45.930272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-02T23:41:45.766345Z","title":"Glm-4.5: Agentic, reasoning, and coding (arc) foundation models.CoRR, abs/2508.06471, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.766345Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:9d098a427810b8c67445836ccda88fc0a03861ea4465fb1dcc4392dfc23c4857","observation_id":"5312309a-044c-49d6-bfc6-5dc8604930c6","resolution":{"observed_at":"2026-08-02T23:41:45.766345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.142352Z","title":"Scientists’ first exam: Probing cognitive abilities of mllm via perception, understanding, and reasoning.arXiv preprint arXiv:2506.10521, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.142352Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:ac2eab4930420b02a57a7ca099f97b23bff35a3932fcca9f2725482f30d009a5","observation_id":"a4e71bd1-acc7-45b5-8874-68bee738df54","resolution":{"observed_at":"2026-08-02T23:41:46.142352Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-02T23:41:46.044618Z","title":"Webarena: A realistic web environment for building autonomous agents.arXiv preprint arXiv:2307.13854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.044618Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:0a97d3027de6d447362de525a06ca7cfd496527d5cbb51bdd1d079c182b07181","observation_id":"7e2daef1-1a3a-45d7-9cdb-109302624488","resolution":{"observed_at":"2026-08-02T23:41:46.044618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.239829Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.239829Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:ae1a6845e00896a1979d28985bb7de7105628e0128e1831773b04694cf071f65","observation_id":"df752ca1-612f-4c9f-8f17-37053c441d98","resolution":{"observed_at":"2026-08-02T23:41:46.239829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.339736Z","title":"•Standard Return:{’result’: main_value, ’metadata’: {...}}(e.g., units, status flags, data sources)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.339736Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:afda6ed42e76a711bbe2c5944429b113254c42fa37fe1f21ea373c5708711665","observation_id":"b1a4de21-0e95-4915-a80c-9eeca4213bd3","resolution":{"observed_at":"2026-08-02T23:41:46.339736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.446763Z","title":"•Type Hints:All tools must provide complete Python type hints for parameters and return values","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.446763Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:888bee513278c94a92159b081b2f7c945025c559952223f43a1e077005abbb97","observation_id":"e5ff4846-6c47-45d5-a582-582625dc238e","resolution":{"observed_at":"2026-08-02T23:41:46.446763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.552473Z","title":"•Query:Retrieve hierarchical facts/records from external resources or local indices and return normalized fields for downstream steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.552473Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:07f812fdc5fe028104da73db18b844f95406185b134a923cfa3aa7c87d409fda","observation_id":"a0a8b7f6-be47-432e-b27b-768bd2e50fac","resolution":{"observed_at":"2026-08-02T23:41:46.552473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.629695Z","title":"must include X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.629695Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:08cd976cf9e9eba31cd3e79da770efa89205211ce5511da852e886e1ee22b542","observation_id":"128b0d44-45b7-4905-b6de-2b5d57aed577","resolution":{"observed_at":"2026-08-02T23:41:46.629695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.712280Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.712280Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:f1f83d80ee0d1a11b90960e33dd95ff4f9f42cc4d16241e43c89f947920e8a66","observation_id":"62b6cd3d-2f28-46bd-8a08-6aed599e8cc9","resolution":{"observed_at":"2026-08-02T23:41:46.712280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.758337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.758337Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:0f09923c6709ebb7bd3f33db86d2762420b61a2bef10471fbcae9f69fbb95ed6","observation_id":"3848077d-eac6-431d-85a0-b01af5be0ee1","resolution":{"observed_at":"2026-08-02T23:41:46.758337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:46.847782Z","title":"Tool-round limit exceeded; stopped automatically","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:46.847782Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:ae6b75c10a0f8445c0caaa7415f79cabdcb962a4db0a4ec1aa5f00d79e162fe9","observation_id":"039c8a1a-3706-4739-84ad-c9d4779a0ae3","resolution":{"observed_at":"2026-08-02T23:41:46.847782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T23:41:43.364678Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":774,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:43.364678Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:1e1a203e9189e5ba6d465505fceb5f005c62bf9b370100f53b107eda63c060dc","observation_id":"6ac35669-a6d2-4d1a-adbe-3287f9bab8c2","resolution":{"observed_at":"2026-08-02T23:41:43.364678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:41:41.688635Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:41.688635Z"},"links":{"citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:91cebf6dd63f768bf330eb60ea4125fe671359c1e0bb357f0078aa28f941f438","observation_id":"23f30786-a418-42b2-961e-5a0b4ebefc36","resolution":{"observed_at":"2026-08-02T23:41:41.688635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T13:19:17.768499Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2602.12984."}