{"as_of":"2026-08-05T03:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:741c6c87d79e001ff96903c64b21bfa501c4646fa6a577973b7261531ec125f1","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T11:33:21.391661Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T19:01:21.650333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T19:07:35.241005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"cited_work":{"arxiv_id":"2604.22937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.22937","snapshot_observed_at":"2026-07-10T19:07:35.241005Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","venue":"cs.CL","work_id":"384938ff-460a-4526-9bed-b4d94b193834","year":2026},"citing_paper":{"arxiv_id":"2607.07436","last_updated":"2026-07-08T14:08:04Z","snapshot_observed_at":"2026-08-04T04:59:57.350516Z","submitted_at":"2026-07-08T14:08:04Z","title":"The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T19:01:21.650333Z"},"links":{"cited_paper":"/paper/2604.22937","citing_paper":"/paper/2607.07436"},"observation_digest":"sha256:69452ecc2e7e7f96e8e0ca7c635be7de0efa3b3e7772ea3ea2467b3caf4254e2","observation_id":"939fb746-b159-48e3-a0cc-4d79b29405b3","resolution":{"observed_at":"2026-07-10T19:07:35.244603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.22937/citation-record","integrity":"/paper/2604.22937/integrity","json":"/paper/2604.22937/citation-record.json","paper":"/paper/2604.22937"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.938856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"38c07273-5071-4bbb-b2af-067af11becc7","year":null},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:82762ed4be6ae82c2d9292e4ee6947c1218ceeded724effb0f6e7061b0be7fb2","observation_id":"c46bb44e-3c1a-4045-b196-572805592936","resolution":{"observed_at":"2026-05-26T14:07:51.807847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:4a531c5592f456fdc0465e6fdc1f7ea0486a5130124bcaa14a705a9bc7922db1","observation_id":"36aafd43-bd3d-4c22-830f-d6076901e1b1","resolution":{"observed_at":"2026-05-26T14:07:51.829409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":"2505.23281","doi":"10.48550/arxiv.2505.23281","metadata_source":"pith","pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","venue":"cs.AI","work_id":"61e8d872-ccc7-46b8-8ec1-94008704c941","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ede8026f03e5df356392dcb5655d2e0ab89465ebfd3fa3e486f8776c2fa60b30","observation_id":"44cdc814-62bf-4033-9e5f-a12af7dc4de3","resolution":{"observed_at":"2026-05-15T00:10:14.938194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:e169c066dc7074694d627641dad99fd694b05e1dff0a46cce29f0cac4c40ac36","observation_id":"7407d28d-99e4-4b14-b14a-af2bcd5a30c8","resolution":{"observed_at":"2026-05-11T19:36:13.750346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13820","last_updated":"2025-07-30T14:58:42Z","snapshot_observed_at":"2026-07-06T20:39:15.111209Z","submitted_at":"2025-02-19T15:32:11Z","title":"Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning","version":3},"cited_work":{"arxiv_id":"2502.13820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13820","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28945f99-a70f-4b93-87eb-57687f116a71","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2502.13820","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:2aeb7076ec8e5baac79695aed54037af40deb7eeb32f444fa986ba79ac9738b4","observation_id":"1ebfef7f-f252-4e21-aae1-29f8a5981718","resolution":{"observed_at":"2026-05-11T19:36:13.787691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a463da1e-e725-4cc5-bd81-6cdc7f54ce73","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:42d8cc68a34922061d545e94dca141f62f7f362153a3d6d0552124c403b7e369","observation_id":"d8ea1117-5b30-456d-8dac-147a32ff1d04","resolution":{"observed_at":"2026-05-26T14:07:51.832178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"978d67d1-582d-4053-bafe-0fac3c141380","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:f066428c7f9a06e1b8f9286d2609e21877bd0b612bc2d3a1ec5cffa9acc4ac71","observation_id":"7ecbb288-1d78-4a7c-89a9-b47f84a32448","resolution":{"observed_at":"2026-05-26T14:07:51.820152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond oracle: Verifier-supervision for instruction hierarchy in reasoning and instruction-tuned llms","venue":null,"work_id":"ad84fdb6-547c-47d3-895a-001eb7c5e6fe","year":null},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:3ab769eb41db6b6b94911e73a0aa8553de46567a2e751cc193e51f2076e6ba14","observation_id":"21cfe2ab-2b31-4a46-97d2-828433491170","resolution":{"observed_at":"2026-05-26T14:07:51.813014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:57dc5f3161a29a793eef7d41a7c0cb0b4f671938b5e2f2ce2556685dd8127aab","observation_id":"48029d7e-f467-4632-9309-499a21e736a7","resolution":{"observed_at":"2026-05-11T19:36:13.731528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"819c1fad-02c5-42b5-a3f2-484fc18ff22f","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ea259f23efc79a4e796d2a97325674e9383d89ca7bf2e01b74c4eb57cab1be59","observation_id":"2ac75d33-6d5b-4bf5-b07b-3fe8b882cb8c","resolution":{"observed_at":"2026-05-26T14:07:51.835109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:40:07.881388Z","title":"Process reward models that think","venue":null,"work_id":"5eb327be-4cef-462e-8ccc-1fafa6d30e28","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:b776e4a9627d73db1f170d0bb121b9074546c78873640da48f91750b3f216054","observation_id":"45661ab3-f3cb-4ea9-a9c9-efe335a0f535","resolution":{"observed_at":"2026-05-11T19:36:13.762894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21140","last_updated":"2026-05-31T12:00:00Z","snapshot_observed_at":"2026-08-03T20:08:35.017586Z","submitted_at":"2025-11-26T07:46:46Z","title":"How to Correctly Report LLM-as-a-Judge Evaluations","version":4},"cited_work":{"arxiv_id":"2511.21140","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.21140","snapshot_observed_at":"2026-06-29T22:04:00.693420Z","title":"arXiv preprint arXiv:2511.21140 , url=","venue":"cs.LG","work_id":"e0a5f81a-d626-4818-a040-1bfcae0f3d3d","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2511.21140","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:b7f3b9e344d0139518144a22c34a5c304d97a833df346af91cbfe9f9169778cc","observation_id":"f128a48d-731f-46f1-8d57-728379350875","resolution":{"observed_at":"2026-06-02T03:04:02.584259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5583765c-960d-4020-8c63-9e93d075539e","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:bd06d042107daff59aacc0a236ae778150afe98bc4931bf022cc8418900d2abd","observation_id":"e763ad97-8017-4944-a0c3-90190430f9c1","resolution":{"observed_at":"2026-05-26T14:07:51.815193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:17:10.144588Z","title":"LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge","venue":null,"work_id":"bd49bdd6-b2b5-4c7e-ad0d-cc07261f2b50","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:7ba32a73168c7d6917d7da62b3e52f1d4016e6a2d33adbd195a295f0dda3064e","observation_id":"ec19ef6e-2772-44da-aae4-b49188f278c2","resolution":{"observed_at":"2026-05-11T19:36:13.714408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbe53250-0af9-4ae2-ab4f-d60120e94e60","year":2023},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:aced7559971512becc6df3e30697847d90a1fb87a03cb11f5c84548fc891bf97","observation_id":"8ad72153-e9aa-4dd1-a290-1e3c637781a2","resolution":{"observed_at":"2026-05-26T14:07:51.805284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03329","doi":"10.48550/arxiv.2603.03329","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autoharness: improving llm agents by automatically synthesizing a code harness","venue":"Open MIND","work_id":"319cc429-04ff-4365-ab39-84cffbfeef55","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:7cc5cec2551a57b4c856cfea93096c680448cebd05afea64f62e8c969a687b5f","observation_id":"768b5491-8865-4ee8-963c-b45f37ef4ee0","resolution":{"observed_at":"2026-05-11T19:36:13.775751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f736b47a-310a-43b1-b33a-4d5445382ba7","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:4fe96dc2e4cac2246fcd7fc28ee88e423b1c3d19d523b89d67d3400ee272face","observation_id":"a75a7856-c5f8-409c-b872-eaec0a77c1f8","resolution":{"observed_at":"2026-05-26T14:07:51.799298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5655666b-2d87-4e09-8ca6-fff826718840","year":2023},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:321879a9db5590028bd64a7953728851c2938641789981e9415004abc338eed6","observation_id":"3a597ab0-7276-4732-b31c-d285b5cfc3a8","resolution":{"observed_at":"2026-05-26T14:07:51.810638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25723","last_updated":"2026-05-18T07:29:29Z","snapshot_observed_at":"2026-08-02T12:44:43.781421Z","submitted_at":"2026-03-26T17:58:15Z","title":"Natural-Language Agent Harnesses","version":2},"cited_work":{"arxiv_id":"2603.25723","doi":"10.48550/arxiv.2603.25723","metadata_source":"pith","pith_arxiv_id":"2603.25723","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural-Language Agent Harnesses","venue":"cs.CL","work_id":"9756d161-8a6c-4ba3-8bf8-3af1f9e911d3","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2603.25723","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:cf83f7c4fcfdff2bb7f62a2b8f60543d85d385232c45f2d84b98c753423b7892","observation_id":"91b8ae1e-4a0e-402a-a76c-98d6d5cb03de","resolution":{"observed_at":"2026-05-20T00:04:30.082400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"602ebfa4-7573-42e4-aff0-f42d25bd9078","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:03424d4b2126c8687804cf656cbe3a9b516ad788911d41d2f5c79c9026100e97","observation_id":"89ed779a-d700-45f5-963a-a3e25281d343","resolution":{"observed_at":"2026-05-26T14:07:51.822974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond outcome verification: Verifiable process reward models for structured reasoning.arXiv preprint arXiv:2601.17223","venue":null,"work_id":"af5e19ae-3ee2-463b-b2e4-ff7a6975cea5","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:3deba40c38645c0bd910044c707be5451c1b0216dfa5ebac5f6e0e7482dd831d","observation_id":"67002705-f036-44ce-95a4-3a7e5675ba47","resolution":{"observed_at":"2026-05-11T19:36:13.725542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:ad85159b8cb200c9c0ac1fd48f4fd69aa5de05cb8ed12b99e48fe7f7025bb175","observation_id":"bc17e442-b7b8-4bf7-a2e3-e26fa3ebcc59","resolution":{"observed_at":"2026-05-11T19:36:13.699446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:0ffa738b6352fc4f102f537bc6829a6715ed6646c8611465e51a9e91051b0c65","observation_id":"85b937d4-e414-4c45-83ff-e793b734385e","resolution":{"observed_at":"2026-05-11T19:36:13.679536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:c6ed9e3233c85f4bb378a538569fe6a61c8d34723cc66d7171adb5f0816bbd7a","observation_id":"119e44ff-95f2-4253-a83a-9b506b9a545c","resolution":{"observed_at":"2026-05-11T19:36:13.660771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21117","doi":"10.48550/arxiv.2509.21117","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trust- judge: Inconsistencies of LLM-as-a-judge and how to alleviate them.arXiv preprint arXiv:2509.21117,","venue":"ArXiv.org","work_id":"10d40448-0d0f-4f32-bc22-b2d999802f0d","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:68f63b150948b842380aa86fa286866d2ffcf8839dd8dd7b596cd2a0271a135b","observation_id":"145e1f44-a3ec-43c5-a78b-146fd6307c3c","resolution":{"observed_at":"2026-05-11T19:36:13.649003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3e198d5b-dae1-429c-9cbb-2b6b49ab7f6b","year":2024},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:7a70d78c456acd690f88266bbaf21f2e19ed1bcfd5bf55bfceff05df6bf1f233","observation_id":"51f8e7e6-b35a-42e7-a489-d3107768fd20","resolution":{"observed_at":"2026-05-26T14:07:51.826464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20139","last_updated":"2026-04-02T18:48:19Z","snapshot_observed_at":"2026-07-06T21:30:42.185904Z","submitted_at":"2025-05-26T15:40:42Z","title":"StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs","version":3},"cited_work":{"arxiv_id":"2505.20139","doi":"10.48550/arxiv.2505.20139","metadata_source":"pith","pith_arxiv_id":"2505.20139","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs","venue":"cs.SE","work_id":"78664cfd-b836-422c-9d6f-6566cddaead9","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2505.20139","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:4dfbb0c83dd6c4894762a043da1277965afc4c50dfabede0e7fb267c4ea7b3ba","observation_id":"1017f8af-d607-4e1b-b968-50192fc8f6da","resolution":{"observed_at":"2026-05-11T19:36:13.704509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8bfa50b8-478e-4a1a-9803-922a9118f0a7","year":2022},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:7a66201fecf341e85b37b131a526b8560883d242cdecc5c2c30d1eeabd97d774","observation_id":"7875a516-346b-4f3a-8e20-5c64e9321aca","resolution":{"observed_at":"2026-05-26T14:07:51.802944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02474","last_updated":"2026-05-24T19:01:09Z","snapshot_observed_at":"2026-08-03T05:25:38.558727Z","submitted_at":"2026-02-02T18:53:28Z","title":"MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents","version":2},"cited_work":{"arxiv_id":"2602.02474","doi":"10.48550/arxiv.2602.02474","metadata_source":"pith","pith_arxiv_id":"2602.02474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents","venue":"cs.CL","work_id":"64baa7f3-849b-485e-b081-2074d82f1364","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2602.02474","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:7f1acc191b828e71fa3e5277bbe5f6aced039a4361f26ce7831f5ff31e05a407","observation_id":"099524b1-63dd-425c-b722-87a3f0b40fdd","resolution":{"observed_at":"2026-05-12T09:10:22.017517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16004","last_updated":"2026-04-17T12:27:36Z","snapshot_observed_at":"2026-08-02T20:20:44.264764Z","submitted_at":"2026-04-17T12:27:36Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","version":1},"cited_work":{"arxiv_id":"2604.16004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16004","snapshot_observed_at":"2026-07-04T20:20:07.663758Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","venue":"cs.CL","work_id":"bba2b44a-06ba-4a37-95fc-5e5ede30502d","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2604.16004","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:fa31808505142c2d412374c7f82b889a61c1d055b0db4b75ec356bbff27da573","observation_id":"92666ef6-494a-4a0a-be5b-9eb7e62098bd","resolution":{"observed_at":"2026-05-11T19:36:13.694509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04618","last_updated":"2026-03-29T09:18:02Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:30:18Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","version":3},"cited_work":{"arxiv_id":"2510.04618","doi":"10.48550/arxiv.2510.04618","metadata_source":"pith","pith_arxiv_id":"2510.04618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","venue":"cs.LG","work_id":"c1d09cf9-9176-403d-8028-630bbc0cbc5d","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2510.04618","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:c312db84ad313fa00b2717375533ce66372d5f62fc85c01e9450c5f521da9115","observation_id":"fd5e532e-81b4-4da3-aca3-7a62b4d7a490","resolution":{"observed_at":"2026-05-12T16:44:08.223014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"777dca04-8f82-42e5-8abd-6c3bca685110","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:138e51e94f6b71cb8acb53027d954abdf19354da336a60436752bf28d0d35141","observation_id":"00d1a3ea-39d5-4299-b112-6b2d5ca445a7","resolution":{"observed_at":"2026-05-26T14:07:51.817477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:14:22.186862Z","title":"Available: https://arxiv.org/abs/2603.11445","venue":null,"work_id":"84a15383-b86e-4bed-9fc0-6c8f700b9f3e","year":2026},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:81985793cf371ec53b3eb5fab54332d356163777eeb21aee12111c72364e88c9","observation_id":"f3f8c785-c41e-426c-b7d3-cbd8aa881af9","resolution":{"observed_at":"2026-05-11T19:36:13.668075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10132","last_updated":"2025-01-17T11:41:53Z","snapshot_observed_at":"2026-07-06T20:22:23.609336Z","submitted_at":"2025-01-17T11:41:53Z","title":"ComplexFuncBench: Exploring Multi-Step and Constrained Function Calling under Long-Context Scenario","version":1},"cited_work":{"arxiv_id":"2501.10132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10132","snapshot_observed_at":"2026-06-29T13:13:27.295521Z","title":"ComplexFuncBench: Exploring multi-step and constrained function calling under long-context scenario","venue":null,"work_id":"032fd075-966f-46cd-b9f4-8b03ac993484","year":2025},"citing_paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T11:33:21.391661Z"},"links":{"cited_paper":"/paper/2501.10132","citing_paper":"/paper/2604.22937"},"observation_digest":"sha256:4ea084df862be914132a2cf6845b4b31214ea8b2214ff9145425755788121633","observation_id":"c90841e7-ff2f-4029-b6d1-7a368a59c826","resolution":{"observed_at":"2026-05-11T19:36:13.672811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.22937","last_updated":"2026-04-24T18:22:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-31T06:10:05.175747Z","submitted_at":"2026-04-24T18:22:58Z","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":20,"verified_fuzzy":3},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2604.22937."}