{"as_of":"2026-08-17T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19fbaccc5fd91d21756bebb6b5852318d91ce461a6aacaa65ccfbee7a354bfcb","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:16:08.504844Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:39:03.647525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:55.557008Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T13:48:53.691192Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2509.16941"},"observation_digest":"sha256:9254db0164a6a7f2c2c38b2f18b5aaf15ef35bd73531d8296c7d323b43eb19af","observation_id":"781e070c-9bf1-4920-951e-e58502d4508d","resolution":{"observed_at":"2026-05-12T13:48:53.748215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-04T11:02:07.533516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-14T15:57:21.857274Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.533516Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:6aa1c64591fc77040cf8097410aee764035131f33b221778d11e46fb5a357caf","observation_id":"5b423429-604d-4cd8-81b3-3549e256206a","resolution":{"observed_at":"2026-08-04T11:02:07.533516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-03T07:17:13.394276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20789","last_updated":"2026-05-29T01:36:45Z","snapshot_observed_at":"2026-08-16T09:01:13.123006Z","submitted_at":"2026-01-28T17:27:08Z","title":"SERA: Soft-Verified Efficient Repository Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T07:17:13.394276Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2601.20789"},"observation_digest":"sha256:7e951455c35c6a772da0765ee70f860202f1f9e5fbf7e510c35978c4c959c5c5","observation_id":"be23bde6-0887-4ca3-8224-7e9394f1323a","resolution":{"observed_at":"2026-08-03T07:17:13.394276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-12T22:37:45.905230Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10491","last_updated":"2026-06-26T21:15:41Z","snapshot_observed_at":"2026-08-09T19:01:28.240943Z","submitted_at":"2026-04-12T06:50:43Z","title":"Fate of Secondary Droplets Produced by High-speed Raindrops Interacting with a Liquid Pool","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T22:37:45.905230Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2604.10491"},"observation_digest":"sha256:5105a762843d4a791b0bb42f34e8b5a6c1d9c183b87d239e70f6c10312546f2b","observation_id":"e5d51157-6f35-401b-8ef8-9bbce2b3ba2b","resolution":{"observed_at":"2026-07-12T22:37:45.905230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2604.10493","last_updated":"2026-04-12T06:51:47Z","snapshot_observed_at":"2026-08-05T15:06:05.225966Z","submitted_at":"2026-04-12T06:51:47Z","title":"SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:21:12.961613Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2604.10493"},"observation_digest":"sha256:db77d656bde8fbc4641236f63fd296fd36ecffbb591436626e283d20b6050344","observation_id":"185f9dde-b76d-43cc-aa4a-48b40b711c9d","resolution":{"observed_at":"2026-05-11T09:00:59.385102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:a22eb05d7145e0bf8913b17ed5a3b8db4f0e9960af07808ae727386c9dfcb88e","observation_id":"b3de5738-ffac-4b63-a2f8-55a9dce22fc5","resolution":{"observed_at":"2026-05-10T23:15:49.121327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2605.12969","last_updated":"2026-05-30T10:28:38Z","snapshot_observed_at":"2026-08-16T20:58:21.079455Z","submitted_at":"2026-05-13T04:02:36Z","title":"Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:21:26.640493Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2605.12969"},"observation_digest":"sha256:3ece843bd7b45fc408380071e1b8d9e958c84bdfe650a86ccfd29d226b7f73be","observation_id":"740bad67-0768-4658-9cd9-47c50619a692","resolution":{"observed_at":"2026-05-14T20:22:54.783701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2605.12969","last_updated":"2026-05-30T10:28:38Z","snapshot_observed_at":"2026-08-16T20:58:21.079455Z","submitted_at":"2026-05-13T04:02:36Z","title":"Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T21:42:49.452347Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2605.12969"},"observation_digest":"sha256:4eb502ea5458f5aaf2d91e8edc533297bc409dbe66771add7e6f29d68c2271fd","observation_id":"7bfd02ae-5fcf-4231-b1ec-fc33107928ff","resolution":{"observed_at":"2026-05-20T21:43:45.447084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.01619","last_updated":"2026-06-08T06:27:26Z","snapshot_observed_at":"2026-08-02T17:32:43.717169Z","submitted_at":"2026-06-01T03:12:05Z","title":"ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T14:49:40.239199Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.01619"},"observation_digest":"sha256:19cafc5d82a2284c612a674a1e936a05f2bb1c84e546785b51912137c1b79ded","observation_id":"3a167a8b-7dcc-41da-90bf-ab85eb4d7060","resolution":{"observed_at":"2026-07-01T22:56:20.921429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-13T02:54:16.566025Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:10:06.685591Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:211143fbf30b6af7ab471fc52a45fad3c1a02d3ac4a58029e77c34e9758d8590","observation_id":"076142ad-da01-4de0-a46d-bc4db2f109f8","resolution":{"observed_at":"2026-07-02T02:16:26.212323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-12T15:15:09.675778Z","title":"Agent-RLVR: Training software engineering agents via guidance and environment rewards.arXiv:2506.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-13T02:54:16.566025Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T15:15:09.675778Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:5fd0dba3f48ac7328eda9b243a8e9fa39ca663530900d2366200c861def5b723","observation_id":"9c15bb12-a2e7-4b9f-8422-7f29e39538a1","resolution":{"observed_at":"2026-07-12T15:15:09.675778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.03963","last_updated":"2026-06-09T15:09:32Z","snapshot_observed_at":"2026-08-15T20:13:44.297657Z","submitted_at":"2026-06-02T17:50:15Z","title":"AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:03:54.185019Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.03963"},"observation_digest":"sha256:e32a2fc396cd307eae529331ea0c0adc5d0d87a9b4d156d45ed59a31c312f80e","observation_id":"b55f1ba7-cf7d-4b55-b1b0-60b03a905c3b","resolution":{"observed_at":"2026-07-02T03:26:29.320110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-12T14:52:30.848387Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:56978c527ce65cfa5b89596e06c5667fe38a38add19b1815f738051cbdc2cc09","observation_id":"cdbe7401-d4c8-4938-b932-ec10e1591b6f","resolution":{"observed_at":"2026-07-03T14:58:33.180739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2607.01465","last_updated":"2026-07-01T20:55:07Z","snapshot_observed_at":"2026-08-08T13:34:00.921694Z","submitted_at":"2026-07-01T20:55:07Z","title":"Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-03T20:18:07.134598Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.01465"},"observation_digest":"sha256:57936f8bc028cd09d3847f3fe2fb8b54ba21fea822289cce0af28e9001145340","observation_id":"8f126582-5c6b-4f46-86c0-ef9ee3d9f93d","resolution":{"observed_at":"2026-07-03T20:18:55.558939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards.arXiv preprint arXiv:2506.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-14T07:55:04.341800Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:a0a991f2f70a52b0a914656697815b42784595dd94980dc612396b794c35b38c","observation_id":"daced041-f2dc-4f63-8d6b-cc3dd8ae344b","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-02T14:50:10.280348Z","title":"Wang, Xiang Deng, Yuntao Ma, Nikhil Barhate, and Sean M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-16T04:08:05.621437Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:10.280348Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:ac5deae7f041149ad0471a7ed1dde4911f1de5d0520988e42e76d93bbb7a0d6c","observation_id":"6bd6e6ce-b523-4888-a300-1909ca46bcc4","resolution":{"observed_at":"2026-08-02T14:50:10.280348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-01T02:44:29.759049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-16T08:18:43.479065Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.759049Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:c599e6cde7336be19af131c5c2f0f40628a087a61754eede94bd2e749c18c951","observation_id":"003a6523-95fe-4860-8329-fc4f1bbafd50","resolution":{"observed_at":"2026-08-01T02:44:29.759049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-05T19:47:59.075366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03392","last_updated":"2026-08-04T09:43:46Z","snapshot_observed_at":"2026-08-16T17:48:28.468868Z","submitted_at":"2026-08-04T09:43:46Z","title":"Self-Evolving Coding Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T19:47:59.075366Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2608.03392"},"observation_digest":"sha256:6c705e657660c2d00dfca16606a12c58b8b69122661ecaad9cec46fe8b566360","observation_id":"a67c7176-23ad-40d9-a1f1-c3825501dc7b","resolution":{"observed_at":"2026-08-05T19:47:59.075366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-10T04:39:03.647525Z","title":"Agent- rlvr: Training software engineering agents via guidance and environment rewards.arXiv preprint arXiv:2506.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07437","last_updated":"2026-08-07T17:22:00Z","snapshot_observed_at":"2026-08-15T02:38:57.281075Z","submitted_at":"2026-08-07T17:22:00Z","title":"Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T04:39:03.647525Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2608.07437"},"observation_digest":"sha256:cdd3354a2306fd9c0e7786616dd84218651a8f4dc3f92731d12673962fb0817a","observation_id":"ca4ee6f6-5d92-472b-95e6-2c5810b604f1","resolution":{"observed_at":"2026-08-10T04:39:03.647525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11425/citation-record","integrity":"/paper/2506.11425/integrity","json":"/paper/2506.11425/citation-record.json","paper":"/paper/2506.11425"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:16:08.416963Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.416963Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:f6ae125965c3bf9a5a0e94590b58a439604644331f8fb245360613e96813b058","observation_id":"2e8a4e8c-3519-4492-9a04-355aaf229ffb","resolution":{"observed_at":"2026-08-07T04:16:08.416963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.788977Z","title":"Jimenez, John Yang, Leyton Ho, Tejal Patwardhan, Kevin Liu, and Aleksander Madry","venue":null,"work_id":"3de8afa3-7984-4946-952a-3e2a7c3a23d7","year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.420827Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:0f6920a942a1aa2d009138acac688d7b10f81107c0914e61b43f1caef5a4a063","observation_id":"2be21a07-10c6-4a7e-8a2c-de4d7ffe1fbd","resolution":{"observed_at":"2026-08-07T04:16:08.792345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.779422Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Francis Christiano","venue":null,"work_id":"82b6c304-901f-44f3-a7ff-172bdd7934fa","year":2020},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.424091Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:72a247890a7a4ba0809b871c4a0d71bec434ab7de29f335aff4120605fd6f87e","observation_id":"26e9f587-880d-4a73-af48-7edce2138133","resolution":{"observed_at":"2026-08-07T04:16:08.782440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T04:16:08.427531Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.427531Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:eac973a825c413cf8bd593cbfc5f27671e846378e19aeff017a438f277a13af0","observation_id":"9ef3b7a6-547a-4159-8202-4cc7b3f3955b","resolution":{"observed_at":"2026-08-07T04:16:08.427531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T04:16:08.431125Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.431125Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:40f815abfe1f055b0c61d32bc80a6712ecafcce8b53c8259135794618243438c","observation_id":"52a0bac0-0a79-48b3-9954-97d235ffae56","resolution":{"observed_at":"2026-08-07T04:16:08.431125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T04:16:08.434730Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.434730Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:704fb9ac24c24810c2d76172251993aa66d3580a4bffe8c992354eceacec5a30","observation_id":"648ece32-822b-46ac-bbb7-c8210ea004b3","resolution":{"observed_at":"2026-08-07T04:16:08.434730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T04:16:08.438286Z","title":"Measur- ing coding challenge competence with apps.ArXiv, abs/2105.09938, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.438286Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:33202444ac3e1ec3893c8b0d34c4e4f73b0fa7e0b0a6c3b6f438f8cd40aebf4c","observation_id":"296b8740-ec45-45a5-ac84-fbdb4c8ad79e","resolution":{"observed_at":"2026-08-07T04:16:08.438286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03733","last_updated":"2024-10-18T23:53:07Z","snapshot_observed_at":"2026-08-16T13:20:58.722894Z","submitted_at":"2024-09-05T17:44:49Z","title":"Planning In Natural Language Improves LLM Search For Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03733","snapshot_observed_at":"2026-08-07T04:16:08.441362Z","title":"Hendryx, Summer Yue, and Hugh Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.441362Z"},"links":{"cited_paper":"/paper/2409.03733","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:4153ee3900f152962c0de3b20d45ff166d2964e318cfb65c333b723c5e308c91","observation_id":"d0d8936d-8db1-40fc-b6db-a3e511e0c6b0","resolution":{"observed_at":"2026-08-07T04:16:08.441362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T04:16:08.444325Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.444325Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:f1791c3f19188419b0947a915f397d8b6c3f790b88d32ac67ffae02660abe628","observation_id":"4315de77-c1db-4f60-8992-5305968fe354","resolution":{"observed_at":"2026-08-07T04:16:08.444325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21139","last_updated":"2025-06-06T07:53:20Z","snapshot_observed_at":"2026-08-16T19:05:11.273764Z","submitted_at":"2024-12-30T18:15:39Z","title":"Training Software Engineering Agents and Verifiers with SWE-Gym","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21139","snapshot_observed_at":"2026-08-07T04:16:08.447400Z","title":"Training software engineering agents and verifiers with swe-gym.ArXiv, abs/2412.21139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.447400Z"},"links":{"cited_paper":"/paper/2412.21139","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:48154684a026a19482c88bcffedb6762f51609e678d1ac7a1369fd12b416478c","observation_id":"d9d2ea16-8ced-45e5-b3b9-8b4c7e20e7a4","resolution":{"observed_at":"2026-08-07T04:16:08.447400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.450383Z","title":"STar: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.450383Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:02c24ee73219a308d4aff90a21b40b50a3200c00e73064b408c76dd6c3c6b1d5","observation_id":"ca8a7a1b-1699-4885-a4f5-e1e89984aa7a","resolution":{"observed_at":"2026-08-07T04:16:08.450383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T04:16:08.453021Z","title":"Doucet, Orhan Firat, and Nando de Freitas","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.453021Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:a081f5bd47a6de10eb33e0275b9c6091166d6fe51d18d7f96318b9ea6543960e","observation_id":"3a744ce8-b809-4fce-8d52-db70b358bad4","resolution":{"observed_at":"2026-08-07T04:16:08.453021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-08-15T15:29:54.860240Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-07T04:16:08.456160Z","title":"Agentless: Demystifying llm-based software engineering agents.ArXiv, abs/2407.01489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.456160Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:33c650fb77179808e5e0cb1f87dd14f6d9fd26c5cbdbb050708771cbe2ceb181","observation_id":"beb20196-bca5-4497-ad80-500001be350b","resolution":{"observed_at":"2026-08-07T04:16:08.456160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.763289Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H","venue":null,"work_id":"b6cfca7e-3399-4f16-b87e-2197e220c226","year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.459059Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:7c8f5ec61c55b4e2919be8e646f643b467b47a81ac09244e40b276e103dfdcb1","observation_id":"1326b1c1-5622-47b3-b55f-f8146d15cacb","resolution":{"observed_at":"2026-08-07T04:16:08.767942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05040","last_updated":"2025-05-07T04:06:41Z","snapshot_observed_at":"2026-08-15T15:19:40.400284Z","submitted_at":"2025-01-09T07:54:24Z","title":"SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05040","snapshot_observed_at":"2026-08-07T04:16:08.461930Z","title":"Swe- fixer: Training open-source llms for effective and efficient github issue resolution.ArXiv, abs/2501.05040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.461930Z"},"links":{"cited_paper":"/paper/2501.05040","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:f94820bc57e755f90c058f486cc8d30a0b701b8e0cfae929381ed293e585b65c","observation_id":"0d47d712-a232-45d9-8689-ce8afc3db309","resolution":{"observed_at":"2026-08-07T04:16:08.461930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-08-13T07:37:18.494967Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T04:16:08.464749Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution.ArXiv, abs/2502.18449, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.464749Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:0c049afafac2ef81c0030ed5d2f40d6a9bc142af85ac0c96866b005a7c171905","observation_id":"23dfffdb-63d4-418f-819d-d61496ea7326","resolution":{"observed_at":"2026-08-07T04:16:08.464749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-16T15:36:01.098847Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-07T04:16:08.467524Z","title":"Hendryx, Russell Kaplan, Michele Lunati, and Summer Yue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.467524Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:e09117d709e9babb52b0f5a0c5c58501937206b224284bc86dd1ab4b5e7c2c17","observation_id":"1925b323-2750-4627-87d1-38c89723b7df","resolution":{"observed_at":"2026-08-07T04:16:08.467524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T04:16:08.471002Z","title":"Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Chris Wilhelm, Luca Soldaini, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.471002Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:d7d890f3101fed1b46df1c39d1c143ae0050e08b4beb3c1284fcc73d98ee7402","observation_id":"1e6cc14a-eafc-44b5-8a91-32cb06d268a9","resolution":{"observed_at":"2026-08-07T04:16:08.471002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:16:08.473951Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.473951Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:68beaf64bcee1fd8818654b91f7b94aea3ae1dd3a627a31e8d48913b01fe5824","observation_id":"28a93968-05ef-4510-b354-23379f10466e","resolution":{"observed_at":"2026-08-07T04:16:08.473951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01769","last_updated":"2024-12-02T18:11:30Z","snapshot_observed_at":"2026-08-16T13:00:36.641418Z","submitted_at":"2024-12-02T18:11:30Z","title":"Commit0: Library Generation from Scratch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01769","snapshot_observed_at":"2026-08-07T04:16:08.477293Z","title":"Chiu, Claire Cardie, Matthias Gall’e, and Alexander M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.477293Z"},"links":{"cited_paper":"/paper/2412.01769","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:b54f0ceba628a66eec9cb538469e9166705156d7824c3e6c3224a021d8de5321","observation_id":"9c9ef027-3deb-4379-bb19-94e1e6950ccf","resolution":{"observed_at":"2026-08-07T04:16:08.477293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-07T04:16:08.480495Z","title":"Jimenez, Alexander Wettig, Kilian Adriano Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.480495Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:f02b70c9ad25a2d57c6b8467a6c2b1c05094cca296d7bdbfc97219e86f02943f","observation_id":"ccac6345-da87-4ac5-a2ed-e3325ea68349","resolution":{"observed_at":"2026-08-07T04:16:08.480495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T04:16:08.483469Z","title":"React: Synergizing reasoning and acting in language models.ArXiv, abs/2210.03629, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.483469Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:06b74c2353d4fe29e9b8fd6d1a8f2f15b83525f54754fbe8dafcb4daebf2a376","observation_id":"76698c99-b65f-464a-9946-d155b06aff8d","resolution":{"observed_at":"2026-08-07T04:16:08.483469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T04:16:08.486283Z","title":"Proximal policy optimization algorithms.ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.486283Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:dd06805dd7e380fd0fa2d286a6ddf7f7d64169b0a2299223b25ef42704adb373","observation_id":"110172c0-7cf8-4510-8de3-9f3642ec23ee","resolution":{"observed_at":"2026-08-07T04:16:08.486283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:16:08.489630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.489630Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:91b8c38bae776e94830b8b0e922fc9c69fb1e5436f4ece60aa33475c962462ea","observation_id":"228809fc-4eca-4d16-96c0-1a1a8348cfe5","resolution":{"observed_at":"2026-08-07T04:16:08.489630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-14T22:26:00.902198Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T04:16:08.492855Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.ArXiv, abs/2404.07972, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.492855Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:ef0a2684ec9096a7b52814d725b6ac0384bb165723d6ed33a9bd4a903e43e676","observation_id":"e082b267-d4f3-424e-adf6-f4a1d9132bfd","resolution":{"observed_at":"2026-08-07T04:16:08.492855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-08-14T08:19:18.935225Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-07T04:16:08.495825Z","title":"Mind2web: Towards a generalist agent for the web.ArXiv, abs/2306.06070, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.495825Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:e83d2c8ebca8c92de9af98f54fea37cfeea11203fc1e1ac6d1fd034e597b91a6","observation_id":"c4f109a2-c72f-48c7-b4d2-63befd7472aa","resolution":{"observed_at":"2026-08-07T04:16:08.495825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01290","last_updated":"2025-01-02T15:10:52Z","snapshot_observed_at":"2026-08-13T18:06:31.211892Z","submitted_at":"2025-01-02T15:10:52Z","title":"ToolComp: A Multi-Tool Reasoning & Process Supervision Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01290","snapshot_observed_at":"2026-08-07T04:16:08.498785Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.498785Z"},"links":{"cited_paper":"/paper/2501.01290","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:56ed0ac9f3326f312c64044a7e953f580249e6605810e21b02787eb82d41a883","observation_id":"05cff3f7-a161-4d6c-9da5-72e6cb9872cf","resolution":{"observed_at":"2026-08-07T04:16:08.498785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-08-16T21:34:35.147772Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T04:16:08.501801Z","title":"Ui-tars: Pioneering automated gui interaction with native agents.ArXiv, abs/2501.12326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.501801Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:48bafd14459dc2b028c823c1b53e6c0139263e40034b5bb050c835bbd79411fb","observation_id":"83c58c56-16f3-4c58-97a3-5084691e6531","resolution":{"observed_at":"2026-08-07T04:16:08.501801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-16T13:03:04.610722Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T04:16:08.504844Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning.ArXiv, abs/2411.02337, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.504844Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:f440bec6da4a40976c6fcc5e11a09c3660a5e2ad8b7763c5b8a2a794a43110a9","observation_id":"e6aefe98-2f29-4ad0-b8e9-c6a42f5efe51","resolution":{"observed_at":"2026-08-07T04:16:08.504844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 19 inbound Pith citation observations for arXiv:2506.11425."}