{"as_of":"2026-08-15T19:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:137fd583a70f0b933eff07771bac5026aeeb160e8b6aa766d89bc99a28a14239","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:03:54.161918Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T15:44:36.354899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-13T23:20:05.248747Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:36.354899Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:be13fd9b9926dbf15866c16208edee19e8ec850bd66e85d69df5846ff6faf469","observation_id":"f32edaa0-bd51-4cb7-81a7-533956c446c1","resolution":{"observed_at":"2026-08-07T15:44:36.354899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T15:42:32.736707Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-14T18:50:38.245723Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:32.736707Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:ee94080368d669021275389846dab9d9863a6b91d81f02f1d8a475de530e002c","observation_id":"f62d10de-d64c-42de-b2d7-77681a765934","resolution":{"observed_at":"2026-08-07T15:42:32.736707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T13:09:02.846595Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:02.846595Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.22648"},"observation_digest":"sha256:51e708361b1b5f470fd3832a827bd02486694630750268154bce49e4a6fb96ba","observation_id":"6fc74151-5eff-4081-a180-57d2aad2b823","resolution":{"observed_at":"2026-08-07T13:09:02.846595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-07T12:16:26.754466Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning.arXiv preprint arXiv:2505.00024, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-14T11:43:59.761174Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:26.754466Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:de369d5bb487b096c0edb296cac407a3eab720d7946aa3ddd1f1356fa1f2cbe7","observation_id":"7932a883-2bfe-4888-803c-20a7cea739a8","resolution":{"observed_at":"2026-08-07T12:16:26.754466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-06T13:47:38.076693Z","title":"Nemotron-Research-Tool-N1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20199","last_updated":"2025-08-13T10:58:50Z","snapshot_observed_at":"2026-08-12T16:55:57.874456Z","submitted_at":"2025-07-27T09:38:32Z","title":"StepFun-Prover Preview: Let's Think and Verify Step by Step","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:47:38.076693Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2507.20199"},"observation_digest":"sha256:bb4b8f5e53f2cd2c201ab7af9611eb47668dffe83da272da9d1c4e1514a368f5","observation_id":"1d3b4cfe-bc69-4358-96c9-0d690ce2e958","resolution":{"observed_at":"2026-08-06T13:47:38.076693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T16:22:51.631063Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-13T12:45:20.389437Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.631063Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:ae6d9f058716dc337b40c879ac6bb2ca4dfc16523f6436ec6cfd9399b6722d44","observation_id":"159b4990-e5c7-4400-b315-9e5dbff73feb","resolution":{"observed_at":"2026-08-05T16:22:51.631063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T14:49:00.746594Z","title":"arXiv preprint arXiv:2505.00024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20931","last_updated":"2025-09-01T18:05:06Z","snapshot_observed_at":"2026-08-14T23:07:30.998043Z","submitted_at":"2025-08-28T15:57:33Z","title":"How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $\\tau$-bench","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:49:00.746594Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2508.20931"},"observation_digest":"sha256:74678a571a28613593fa49457eef5e0655c192d47f4f38722192273801b8a40b","observation_id":"d2a6fe6a-5e9d-4f0b-9f1d-f754a154fbe8","resolution":{"observed_at":"2026-08-05T14:49:00.746594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T13:24:39.953253Z","title":"Nemotron-research-tool-n1: Exploring tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.953253Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:3e61d0c3fac120202da7e6086e8f5f2b699d60e02ad2c451fb74546055f01d80","observation_id":"8d24ae44-7827-42b1-bf90-4ea7efc56487","resolution":{"observed_at":"2026-08-05T13:24:39.953253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T12:27:05.083989Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-11T14:52:56.759096Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:05.083989Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:2f563ce2da94d03ea5bbaaadb3e9326b63b88bc2a0272679137fea75536133d1","observation_id":"d928ccf2-7034-4c4f-a90f-1b64febeffe8","resolution":{"observed_at":"2026-08-05T12:27:05.083989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2510.06499","last_updated":"2026-04-10T04:08:43Z","snapshot_observed_at":"2026-08-13T10:33:06.026096Z","submitted_at":"2025-10-07T22:30:59Z","title":"Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T08:39:54.747656Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2510.06499"},"observation_digest":"sha256:2892a6b5fc76fc322fb756e54d98016dea2a0ad422ab8c789234b7416d5ec3b9","observation_id":"6a2fa7a9-9b77-4d60-865b-50ae03e35d12","resolution":{"observed_at":"2026-05-18T08:41:08.319271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:c5a94cb5045d950b829f23834fb4f06c0fbca3f9c01af8bc86af63d69c565019","observation_id":"bb5db8fd-4415-4d2c-bb58-9cc652e33de5","resolution":{"observed_at":"2026-05-17T23:15:26.752887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-03T05:28:16.047540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02244","last_updated":"2026-07-14T10:18:39Z","snapshot_observed_at":"2026-08-14T23:45:08.458850Z","submitted_at":"2026-02-02T15:53:55Z","title":"Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T05:28:16.047540Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2602.02244"},"observation_digest":"sha256:f5bd5efcb6b1cfd81e36eaf462678b70a558cc280bb0c80a52781e6edf187247","observation_id":"9a615701-ee8e-4f43-88ba-0606415905e3","resolution":{"observed_at":"2026-08-03T05:28:16.047540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2604.09712","last_updated":"2026-04-08T06:28:03Z","snapshot_observed_at":"2026-08-15T03:27:56.745009Z","submitted_at":"2026-04-08T06:28:03Z","title":"LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T19:26:23.660206Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2604.09712"},"observation_digest":"sha256:4beeffa1aab1a678cb2cbd2a82755641f6947095265eb2bedae6eb03adfb1f80","observation_id":"e642e121-706e-41e9-a0b6-4f77905bd761","resolution":{"observed_at":"2026-05-10T23:00:47.686992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-08-11T13:17:03.926866Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:1864e1b8ee6c4a9a4ee9471126e9543ec46eb97e06bda4cc42b55d10088348e8","observation_id":"f7167414-ff93-4c04-9fb4-de6f59864fb9","resolution":{"observed_at":"2026-05-11T06:15:58.363701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2604.17739","last_updated":"2026-05-07T10:48:35Z","snapshot_observed_at":"2026-08-11T17:05:27.323018Z","submitted_at":"2026-04-20T02:54:02Z","title":"Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T04:52:37.197183Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2604.17739"},"observation_digest":"sha256:977e8fe1b8c9f9f2970a114653048b17c057e05022a8f7a7efd06bfe178c8bbc","observation_id":"142182ba-3d01-4ab8-8105-7d86ff9c2db3","resolution":{"observed_at":"2026-05-10T11:25:20.381487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2604.20316","last_updated":"2026-06-02T07:07:49Z","snapshot_observed_at":"2026-08-11T07:58:02.845339Z","submitted_at":"2026-04-22T08:13:24Z","title":"R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T00:31:31.327074Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2604.20316"},"observation_digest":"sha256:2a27506ce0bf1fe54919510d63139ae27af0398f2ea119cb90c82542e7bc84a5","observation_id":"97593b0d-1f44-478e-8c0e-abbda9ea3e8c","resolution":{"observed_at":"2026-05-11T13:46:05.598895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2604.20316","last_updated":"2026-06-02T07:07:49Z","snapshot_observed_at":"2026-08-11T07:58:02.845339Z","submitted_at":"2026-04-22T08:13:24Z","title":"R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-05T04:32:42.150335Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2604.20316"},"observation_digest":"sha256:7e628efd4ca98f14682ae7d18f26e81c6f77cf3aa7f92f2c2d9e0c5864feb371","observation_id":"5287c186-a7de-47a5-a21d-5b2c0e598478","resolution":{"observed_at":"2026-07-05T04:40:40.695576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.03476","last_updated":"2026-05-05T08:05:31Z","snapshot_observed_at":"2026-08-14T21:07:43.360459Z","submitted_at":"2026-05-05T08:05:31Z","title":"CuraView: A Multi-Agent Framework for Medical Hallucination Detection with GraphRAG-Enhanced Knowledge Verification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T04:07:33.610288Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.03476"},"observation_digest":"sha256:a72b825533b62e3d35b3e7259e1be149edd3d2c295e84f809e84e2168cb27989","observation_id":"50d2d743-3da8-4f94-95d3-0edc9010f587","resolution":{"observed_at":"2026-05-12T10:56:30.586469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.09730","last_updated":"2026-05-15T19:01:49Z","snapshot_observed_at":"2026-08-11T06:20:36.894657Z","submitted_at":"2026-05-10T19:57:32Z","title":"RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T03:37:09.000442Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.09730"},"observation_digest":"sha256:65df3e56582d007604e9c7ac1b503d634a518b49e681728d41b84b5d5fd4e13a","observation_id":"60d09fb1-7a28-4c2c-9a49-5cb1d35291c4","resolution":{"observed_at":"2026-05-12T07:11:26.747358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.09730","last_updated":"2026-05-15T19:01:49Z","snapshot_observed_at":"2026-08-11T06:20:36.894657Z","submitted_at":"2026-05-10T19:57:32Z","title":"RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T05:25:43.890367Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.09730"},"observation_digest":"sha256:4d7cc4d14d413c9089729ae2498b0eb79940bbee286806bba0b25f770057c109","observation_id":"1691925d-e988-412a-b22d-2a65c095f354","resolution":{"observed_at":"2026-05-15T05:29:48.025544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.09730","last_updated":"2026-05-15T19:01:49Z","snapshot_observed_at":"2026-08-11T06:20:36.894657Z","submitted_at":"2026-05-10T19:57:32Z","title":"RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T22:12:23.680155Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.09730"},"observation_digest":"sha256:de3e7709d667faa18e45f5223747c9417894f6d3dfd2f835dca9fd72b947a3a4","observation_id":"e24e6cda-8f49-44bc-8708-0ee6cce84a0f","resolution":{"observed_at":"2026-05-20T22:13:47.042443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-13T21:56:55.866334Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T07:30:41.399083Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:621c508456a0e8019937e7500c692c13b1df8c56c9ef08b03f66091f16c12038","observation_id":"b610b465-0527-41fb-bae3-78b36d5cee19","resolution":{"observed_at":"2026-05-13T07:32:29.756995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-13T21:56:55.866334Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:12ac544b7c147704379e4c1bfa7372db04e14f10b7849e6de89d7f68cc486868","observation_id":"43e4fe24-08dc-4499-af74-b9b8f36dbb38","resolution":{"observed_at":"2026-05-15T06:05:06.427969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.14126","last_updated":"2026-05-13T21:27:21Z","snapshot_observed_at":"2026-08-13T11:22:47.550352Z","submitted_at":"2026-05-13T21:27:21Z","title":"Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T04:56:21.439473Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.14126"},"observation_digest":"sha256:6896ce35cfd87833e1bcb40d12e51716cca7d8966c2aa5b581c1f01eae992b52","observation_id":"e15b3f73-7bf1-4501-ab0a-b930c5a74237","resolution":{"observed_at":"2026-05-15T04:59:44.534655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:293ee9124c057df8f6469efd6de8dcfbb52b11394c45b85ed6d5ddbb8feb03e0","observation_id":"131cda4a-c012-41cc-bbb6-824cbd1c1fa7","resolution":{"observed_at":"2026-06-29T08:03:13.511091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2606.00135","last_updated":"2026-08-10T22:45:13Z","snapshot_observed_at":"2026-08-15T10:08:46.851221Z","submitted_at":"2026-05-28T22:21:47Z","title":"On Effectiveness and Efficiency of Agentic Tool-calling and RL Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T08:38:52.411671Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2606.00135"},"observation_digest":"sha256:4d02c1279609badb54fb45f998382d48656513868638bac4d656a51a79d246a7","observation_id":"623b7556-ad61-4315-ad77-6ff632f35973","resolution":{"observed_at":"2026-06-29T08:43:15.374233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2606.03892","last_updated":"2026-06-03T17:27:54Z","snapshot_observed_at":"2026-08-14T00:12:30.816902Z","submitted_at":"2026-06-02T16:52:31Z","title":"Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T09:54:00.111238Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2606.03892"},"observation_digest":"sha256:3e22cef6f6ef0ec7c02e62916713da876fe6a4669acf207e548ec13529a9769f","observation_id":"fa3b5909-2615-42e9-8579-37aa52a39b5e","resolution":{"observed_at":"2026-07-02T03:36:29.699536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2606.09371","last_updated":"2026-06-08T11:48:55Z","snapshot_observed_at":"2026-08-06T09:58:48.976204Z","submitted_at":"2026-06-08T11:48:55Z","title":"Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:00.259139Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2606.09371"},"observation_digest":"sha256:011136b4d8fe57e9594c0a1e3cb4e6c6a9938e9f13cdffc26c35891ba74b598f","observation_id":"53b32c7b-1cbe-468d-aa76-2e2eed45add2","resolution":{"observed_at":"2026-07-03T01:17:30.701824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2606.10875","last_updated":"2026-06-09T13:51:32Z","snapshot_observed_at":"2026-08-13T13:21:36.202460Z","submitted_at":"2026-06-09T13:51:32Z","title":"Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:42.745788Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2606.10875"},"observation_digest":"sha256:05f74be82f74485e03d9ce1ac424a7e07fdab502ee802b73a6a29506d0d77ff4","observation_id":"96f730d3-8d75-45fa-b278-cbec30e2f639","resolution":{"observed_at":"2026-07-03T05:07:39.282163Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-04T23:23:14.686054Z","title":"Nemotron-research-tool-n1: Exploring tool-using language models with reinforced reasoning.arXiv preprint arXiv:2505.00024,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-09T13:33:19.122605Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.686054Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:4c929dd8b7e744d019add7b945911ad0e21b1b0bd81cddc4697321c24a9536ca","observation_id":"8ded1493-716c-4061-a89a-18136fec6c84","resolution":{"observed_at":"2026-08-04T23:23:14.686054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T04:18:15.310447Z","title":"Zhang, Y.; Lin, X.; and Wu, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04007","last_updated":"2026-08-04T17:59:21Z","snapshot_observed_at":"2026-08-14T02:46:35.614873Z","submitted_at":"2026-08-04T17:59:21Z","title":"TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:18:15.310447Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2608.04007"},"observation_digest":"sha256:91124904b8990dfd62817014f0fe95720aa2d4e3eca3bbc800bd654e33f42534","observation_id":"a641ada2-d208-4a43-987a-a284cdd29e67","resolution":{"observed_at":"2026-08-05T04:18:15.310447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-15T15:03:54.161918Z","title":"Benchmarking LLM tool-use in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13179","last_updated":"2026-08-13T12:44:37Z","snapshot_observed_at":"2026-08-15T19:19:16.566974Z","submitted_at":"2026-08-13T12:44:37Z","title":"Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:03:54.161918Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2608.13179"},"observation_digest":"sha256:2c6e28a0f08f850374ca2eb4d1531df86a41b3b2e9c87fc666e277f8a4a35b95","observation_id":"7ff4c1bc-fd62-4dd1-a8fc-b299bc0ae9d3","resolution":{"observed_at":"2026-08-15T15:03:54.161918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00024/citation-record","integrity":"/paper/2505.00024/integrity","json":"/paper/2505.00024/citation-record.json","paper":"/paper/2505.00024"},"outbound":[],"paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2505.00024."}