{"as_of":"2026-08-11T08:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa6bc484ec62de62a111339a1477b517ccfedbb80d9c3d8915942892f605814d","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:11:50.734271Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06933/citation-record","integrity":"/paper/2608.06933/integrity","json":"/paper/2608.06933/citation-record.json","paper":"/paper/2608.06933"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-10T18:11:50.500125Z","title":"Phi-4-mini techni- cal report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.500125Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:995b306416b589ebf594d2c275bd406ae0c1ded4ece69302b16c61f67a0ab5a5","observation_id":"efa5d81a-ea7e-4542-bf75-bbb5206e26c7","resolution":{"observed_at":"2026-08-10T18:11:50.500125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.832170Z","title":"Aimo validation aime","venue":null,"work_id":"12537636-1169-4f8e-9833-ca2aa336f1c9","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.505213Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:3f394566236b09700135ea1aa7293333d8bebcf5d1ec123aa4a6ea899d019a7d","observation_id":"c656d1ed-f976-4f43-8346-17488b02d967","resolution":{"observed_at":"2026-08-10T18:11:51.835244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.823159Z","title":"Analysis of llms for educational question classification and generation","venue":null,"work_id":"6e5d8f90-fe4e-4509-abde-547ac7c9a5a6","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.510391Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:6cc69357a8e9232e06093fdd1990a300ca238de0615a625dd9f33122a2a048a6","observation_id":"e1c4e43f-e11c-44d2-9268-e801337f9a0e","resolution":{"observed_at":"2026-08-10T18:11:51.826511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.813748Z","title":"System card: Claude opus 4.7","venue":null,"work_id":"1bcfa8ac-c48e-48c4-974d-abad7a7eb6b1","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.514698Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:4cb0a3ab3a9fb37a7b05bc289b1cb6b51528a1cac40854ddf58ed1451cbf85e3","observation_id":"fc7fe6e0-3885-4b75-bf24-b4e8498a683c","resolution":{"observed_at":"2026-08-10T18:11:51.817292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.804300Z","title":"System card: Claude opus 5","venue":null,"work_id":"e4f5dbfa-a6ff-45dc-ab7f-f6b785e9a775","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.518591Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:d67baa456ba7a19d21e3c78b82caf3e177fdc0135f9dc0aee83af68cc3079d0a","observation_id":"1a194d04-16af-48b1-8f22-e8867c104af6","resolution":{"observed_at":"2026-08-10T18:11:51.807969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-10T18:11:50.522196Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.522196Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:5be9f3107dab9ac406899276590ee750bf3e92ad80058f2ffef77b89eec0e199","observation_id":"cd994603-6283-4096-9268-0d8779c6a027","resolution":{"observed_at":"2026-08-10T18:11:50.522196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.794343Z","title":"Verifiers: Environments for llm reinforcement learning","venue":null,"work_id":"02c96acf-e953-4175-9a10-a1c66df68f0e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.526191Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:bd6eb4f0dbf63d3447de187affd90a8722e5500d9cee92e86bc01ff5558e7ef3","observation_id":"d11c07f1-1814-4591-8be7-dcb130a3dd06","resolution":{"observed_at":"2026-08-10T18:11:51.798183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-10T06:34:18.837515Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-10T18:11:50.529325Z","title":"Minimax-m1: Scaling test-time compute eﬀiciently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.529325Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:cfbb1e19dacb0af154b36f61306c2ec5bb2eb57d98c9925047b2a3e8058a974a","observation_id":"2a33e1fc-0531-41ec-b56d-5657949b5c17","resolution":{"observed_at":"2026-08-10T18:11:50.529325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03682","last_updated":"2025-09-09T21:50:16Z","snapshot_observed_at":"2026-08-07T23:17:26.856906Z","submitted_at":"2025-08-05T17:51:33Z","title":"Self-Questioning Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03682","snapshot_observed_at":"2026-08-10T18:11:50.533353Z","title":"Self-questioning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.533353Z"},"links":{"cited_paper":"/paper/2508.03682","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:a16f42e05b4a2fd74b0f3a6fb99c7910cb40663832c863588542ee66662947d6","observation_id":"a2c36d90-5999-4462-809d-ca347e4bc748","resolution":{"observed_at":"2026-08-10T18:11:50.533353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-10T18:11:50.537113Z","title":"Self-play fine-tuning converts weak language models to strong language models.arXiv preprint arXiv:2401.01335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.537113Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:8029e7c79af72050d3e7715661953665aa8fd42b32e261de5e8cd1727c5bb44c","observation_id":"3b70dd9b-661e-499b-91e7-0b64f3646c59","resolution":{"observed_at":"2026-08-10T18:11:50.537113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.541212Z","title":"U-math: A university-level benchmark for evaluating mathematical skills in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.541212Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:cffeffad128d4874d813a5b2b2efcc3b97074b0e504e7a5d39510f37d3f3aa8a","observation_id":"b6e85dcd-be73-4c7e-87ee-4d373da1fed9","resolution":{"observed_at":"2026-08-10T18:11:50.541212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-10T18:11:50.544790Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.544790Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:01a5559ab99e67a4899a9ae0dadaa3d9d4ea025e9229f633e5643bbee19119b9","observation_id":"5fe46c7a-337b-4587-975b-ffe74e458367","resolution":{"observed_at":"2026-08-10T18:11:50.544790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.785078Z","title":"Deepseek-v4: Towards highly eﬀicient million-token context intelligence, 2026","venue":null,"work_id":"f2b6930c-f384-41f8-899a-a44c903d6730","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.548548Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:bb6002ec08b25d63799180b16043c9433b4d047a692011a923685644a8c35945","observation_id":"bfbf7f72-bd7f-46fb-9747-130752a64c9e","resolution":{"observed_at":"2026-08-10T18:11:51.788567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.775464Z","title":"Beyond benchmarks: Matharena as an evaluation platform for mathematics with llms","venue":null,"work_id":"d774d9e9-3d73-49c2-bc9f-949f4c13f091","year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.551751Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:1e689068ba7ef57055297ee2e0d1b553ce6347b137fa9c6d33a0590bd4938641","observation_id":"e6fd9ef3-91cf-456e-80bf-b6fa8b9a2bb5","resolution":{"observed_at":"2026-08-10T18:11:51.779230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.765560Z","title":"How useful are educational questions generated by large language models? InInternational Conference on Artificial Intelligence in Education, pages 536–542","venue":null,"work_id":"0877b455-e972-429a-b239-e5bde0d221b3","year":2023},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.558876Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:de352ed853139cf00e8edf3b38223a3db9c053f294e174b50af85dcd422468ca","observation_id":"502b1b30-aeec-434c-a469-96a9eae78ce8","resolution":{"observed_at":"2026-08-10T18:11:51.769622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20293","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.409173Z","title":"When judgment becomes noise: How design failures in llm judge benchmarks silently undermine validity","venue":null,"work_id":"604e76ab-a3be-4573-a6e0-3d03ddef3a53","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.562383Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:03a65bf3052bdb6c29926a776dae3c73e815d3221b8baf768f778f07fbb1ca47","observation_id":"b97c7e30-5b05-44f8-b95d-d1498fbee8f1","resolution":{"observed_at":"2026-08-10T18:11:51.415104Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06802","snapshot_observed_at":"2026-08-10T18:11:50.566726Z","title":"Riemann-bench: A benchmark for moonshot mathematics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.566726Z"},"links":{"cited_paper":"/paper/2604.06802","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:8107e66150b4f05c4b904b86165c4967ef1137529e79e17185f777f24cbb3b39","observation_id":"5e14ca1b-cd89-40ca-be09-6ed819885903","resolution":{"observed_at":"2026-08-10T18:11:50.566726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06187","last_updated":"2025-07-08T17:14:44Z","snapshot_observed_at":"2026-08-07T20:33:47.251399Z","submitted_at":"2025-07-08T17:14:44Z","title":"The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06187","snapshot_observed_at":"2026-08-10T18:11:50.571844Z","title":"The delta learning hypothesis: Preference tuning on weak data can yield strong gains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.571844Z"},"links":{"cited_paper":"/paper/2507.06187","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:0ad203828f3d9d14f915d7c19c518958f39f0c15a3becc3b7478e804aa3d9e22","observation_id":"3a3848f3-e475-4b3c-b983-4fa9d7185d29","resolution":{"observed_at":"2026-08-10T18:11:50.571844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.755912Z","title":"Gemini 3 flash model card","venue":null,"work_id":"26e9f51f-40d2-482a-b583-a39a63795886","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.575958Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:52b1cebde54544b31ac7f8a5b644c84292b91a8247ae8026c0ac7ed8d1fcbde7","observation_id":"1908bcf6-1392-4b46-ba21-976d9c9edb02","resolution":{"observed_at":"2026-08-10T18:11:51.759179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.745555Z","title":"Gemini 3.1 flash-lite model card","venue":null,"work_id":"bcc5350f-5f09-4601-b464-3f166736f71a","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.579452Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:e67a49b1d1b5b50a2706bb8d44e0985ac99915cba5c56b0599604a8c810944be","observation_id":"53591b83-6564-4599-aa8e-4a31887a1be7","resolution":{"observed_at":"2026-08-10T18:11:51.749215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.735457Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":"37ed8720-6d1e-49a8-90cf-77cacb490e31","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.582850Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:0cc51e66eea6a201a0d1b7683c39d6ffef220b264b56a1f433e045b7b9683425","observation_id":"6c9421a9-4842-4779-b5b4-54b16209aaee","resolution":{"observed_at":"2026-08-10T18:11:51.739070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T18:11:50.586404Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.586404Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:eea1c5dafb567554948d8ad09db00e20775d0e68e3bf5020d90cf7b77590b248","observation_id":"3a2faedb-eef0-4eec-a377-aa6d04d4d05e","resolution":{"observed_at":"2026-08-10T18:11:50.586404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T18:11:50.590169Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via rein- forcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.590169Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:a5920905118568ec6c7b26fe38f0b8af824d7daf8f51b8f6d8faf6b6912b8b2f","observation_id":"0689c12c-473c-4bad-94a5-3b7222610bc0","resolution":{"observed_at":"2026-08-10T18:11:50.590169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19464","last_updated":"2024-02-29T18:55:03Z","snapshot_observed_at":"2026-08-10T14:19:11.828078Z","submitted_at":"2024-02-29T18:55:03Z","title":"Curiosity-driven Red-teaming for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19464","snapshot_observed_at":"2026-08-10T18:11:50.594053Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.594053Z"},"links":{"cited_paper":"/paper/2402.19464","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:1a48ed7098c001a7af9197d41b7c6272ba50712ed7498dfa98687e691e139d76","observation_id":"cc36bd4f-8cc3-4f4a-ae6d-c12fcbb776d3","resolution":{"observed_at":"2026-08-10T18:11:50.594053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-10T18:11:50.597606Z","title":"R-zero: Self-evolving reasoning llm from zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.597606Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:fa4ffa2957ff0a19bba202d35f61a3d1cdadbffd66098589eee5b29bb4cce040","observation_id":"717ccbca-0a41-4166-934d-a655cdbebf2b","resolution":{"observed_at":"2026-08-10T18:11:50.597606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.725351Z","title":"Prime-rl, 2025","venue":null,"work_id":"d142827e-8ad5-4e7b-94e6-42a0bcdfdf9e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.601552Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:0c708b309c2df6213a4c66e354090671e1986227ce5c345584f25280a2da3045","observation_id":"294e66dd-40f2-4607-a481-a6879d9ca561","resolution":{"observed_at":"2026-08-10T18:11:51.728622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.711159Z","title":"Dynabench: Rethinking benchmarking in nlp","venue":null,"work_id":"a042eb71-4966-4a81-83b5-c9e9e67eb55a","year":2021},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.604896Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:d154d83403537c61c062cea614e3a952d9da13a3f7448910b000f98e029035e3","observation_id":"6981e59b-bf3b-4d63-a84e-ae727692eeb7","resolution":{"observed_at":"2026-08-10T18:11:51.715982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.608630Z","title":"Language self-play for data-free training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.608630Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:276482fe818fc7d9ea5ef7551d578cf34831eb8c4aa5af0cb31691965a7317a2","observation_id":"446113b1-2f3f-45c2-8d67-7db549fc3486","resolution":{"observed_at":"2026-08-10T18:11:50.608630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.700586Z","title":"Gon- zalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"ceed0d2d-66ed-4178-aae3-69e65351dac7","year":2023},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.612106Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:a7e92e34ec2022e979b96d3d11360a0e3a6890fda3d152b8a110058b2f4273f4","observation_id":"13df65dd-8607-4b72-b58b-5ff62c1e0e6d","resolution":{"observed_at":"2026-08-10T18:11:51.704162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.690157Z","title":"Math-verify: Math verification library, 2025","venue":null,"work_id":"08cb2f11-a62c-467f-965f-037259e1758a","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.615366Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:fa289b866077966c1aa63985b130ae81872f88e16bad5e3cc81302bfad7ac9f0","observation_id":"8967a8b7-97f8-4b70-9447-c1069477f143","resolution":{"observed_at":"2026-08-10T18:11:51.694071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.679250Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":"48cbef3a-db46-485f-abaa-ac3732b1381e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.618711Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:9aef5459633155fb06508b5b1bb82d635d33dc4ce4ae3a299b9772df275f289b","observation_id":"470ef701-a4ee-4aab-bebe-9a93953c26d2","resolution":{"observed_at":"2026-08-10T18:11:51.683200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.621902Z","title":"Questbench: Can llms ask the right question to acquire informa- tion in reasoning tasks? arXiv preprint arXiv:2503.22674, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.621902Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:d2b9941e01d58b7799acec4ed3c7f178413d01d292ef9b507263963af7f13eab","observation_id":"4db5a174-e386-428a-8630-b85c6a3e28d2","resolution":{"observed_at":"2026-08-10T18:11:50.621902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08351","last_updated":"2025-02-28T08:14:49Z","snapshot_observed_at":"2026-07-06T18:44:45.459377Z","submitted_at":"2024-07-11T10:03:47Z","title":"AutoBencher: Towards Declarative Benchmark Construction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08351","snapshot_observed_at":"2026-08-10T18:11:50.625286Z","title":"Autobencher: Towards declarative benchmark construction.arXiv preprint arXiv:2407.08351, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.625286Z"},"links":{"cited_paper":"/paper/2407.08351","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:eb3ebf2bb8f0a067ca4a91681140cba4bec213de2b6beb6ab5cab40ba73c86aa","observation_id":"801b1703-644c-45e4-a82d-4a68979013a2","resolution":{"observed_at":"2026-08-10T18:11:50.625286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-10T18:11:50.629131Z","title":"Ministral 3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.629131Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:2c96be2fa24c92e303cd6dc83b3f59b2130058da69e667a607fdd5dc39e2eeac","observation_id":"eccba2ec-b5c9-4966-9b61-602506596432","resolution":{"observed_at":"2026-08-10T18:11:50.629131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.632730Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.632730Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:5d1643edd53ffbedf90386eb835df7d8c113cadc1d166bce5f32891c5d2624e5","observation_id":"830bbac3-fa23-4507-8b8c-9dc6609eb7a9","resolution":{"observed_at":"2026-08-10T18:11:50.632730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.635959Z","title":"Spice: Self-play in corpus environments improves reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.635959Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:bd8966bff24769ae3c2e74fbd351ae9e8bd61c272ef7f3d5659460f7185261f4","observation_id":"6df9bb33-e2e9-4959-8628-844643a2d72e","resolution":{"observed_at":"2026-08-10T18:11:50.635959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T18:11:50.639187Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.639187Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:da30f4e65b8c435a292c4ce1cc7860ab3569a0de7de170923edba6f3608941b1","observation_id":"c0f1b392-dc92-424d-93f5-f5ee02f51058","resolution":{"observed_at":"2026-08-10T18:11:50.639187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.669005Z","title":"Towards robust mathematical rea- soning","venue":null,"work_id":"33a04835-d4f8-4bea-828d-b0514e7624fe","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.642628Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:cfc952b51c9a7f213c18d661e2183d43a83d0cbabe77c6edc5a92e96c016d617","observation_id":"bd7f4f53-3487-4a99-8e93-2d96dcf06b93","resolution":{"observed_at":"2026-08-10T18:11:51.672607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.658156Z","title":"Learning to ask informative questions: En- hancing llms with preference optimization and expected information gain","venue":null,"work_id":"9940ee91-65d5-449d-a3fd-398828d3b8ed","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.645913Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:795d6c0539c98cf2603b382b357ed5410238b46467836634fc764ede511383c5","observation_id":"4d3cd2da-5fee-41a4-ad8e-252993644ade","resolution":{"observed_at":"2026-08-10T18:11:51.661795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-10T18:11:50.649079Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.649079Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:637fbef69582637e4bb51a70043e2b5a3beb54b125ea976c39134c5a86b81d33","observation_id":"1b9e3709-9074-4b7a-964f-24c0a015d9fa","resolution":{"observed_at":"2026-08-10T18:11:50.649079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.647342Z","title":"gpt-oss-120b & gpt-oss-20b model card, 2025","venue":null,"work_id":"ba76d43f-df9f-482e-9305-48f3e65aeed2","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.652805Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:5320a3bf8483ebe7ea587c48f36e48d8c419075ea57abf30f962d3e91a66dddd","observation_id":"2337c8a9-bd16-4d52-b42b-e13741159a0b","resolution":{"observed_at":"2026-08-10T18:11:51.650788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.637720Z","title":"Aime 2025","venue":null,"work_id":"d12f0584-5019-44e5-9101-57fcfe230e01","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.656289Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:f246da4d40ea26a99dcb669406bb4e0876114001b650c917104a29a4ebb5b17d","observation_id":"77a9dd4d-8c7f-40d2-9ff4-9b79293444a0","resolution":{"observed_at":"2026-08-10T18:11:51.641053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14678","last_updated":"2025-02-20T16:09:55Z","snapshot_observed_at":"2026-08-07T18:01:35.596368Z","submitted_at":"2025-02-20T16:09:55Z","title":"How to Get Your LLM to Generate Challenging Problems for Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14678","snapshot_observed_at":"2026-08-10T18:11:50.660114Z","title":"How to get your llm to generate challenging problems for evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.660114Z"},"links":{"cited_paper":"/paper/2502.14678","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:2f3f8e238a9956b3bbcdf67d7133d4ee093cfed95270413c784ef3b2aeeec5ec","observation_id":"b58bcdae-2001-4096-a004-b3c98b8db571","resolution":{"observed_at":"2026-08-10T18:11:50.660114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17716","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.013071Z","title":"Do reasoning models ask better questions? a formal information-theoretic analysis on multi-turn llm games","venue":null,"work_id":"d27ab729-177e-4b34-bf97-a5d348c30e83","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.663783Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:b4f6388f8338162733eb33515f81c413192305e9dc6410fc5fccae77117edb3f","observation_id":"729b13b6-6126-4d9b-9e34-362ce2f64700","resolution":{"observed_at":"2026-08-10T18:11:51.021984Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.667571Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.667571Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:03f1004b404a9a77d400847b3a204b0fad89c39f797b8fee84f4ae65ccd2fcd9","observation_id":"c1579d25-0b44-48db-9f2b-2aae01ab2e96","resolution":{"observed_at":"2026-08-10T18:11:50.667571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21009","last_updated":"2025-02-03T12:53:41Z","snapshot_observed_at":"2026-08-10T23:24:19.770308Z","submitted_at":"2024-07-30T17:55:36Z","title":"AI-Assisted Generation of Difficult Math Questions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21009","snapshot_observed_at":"2026-08-10T18:11:50.670903Z","title":"Ai-assisted generation of diﬀicult math questions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.670903Z"},"links":{"cited_paper":"/paper/2407.21009","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:9973cfbaa4a15b910a98fd6172f0f4b9701d72ef952d4003885eb84dff34a94f","observation_id":"ade2654e-b2f0-4134-95f6-032253e180fa","resolution":{"observed_at":"2026-08-10T18:11:50.670903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-10T18:11:50.674344Z","title":"OpenAI GPT-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.674344Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:b4f56486950f359af1faaa53da607fc5adf77a5f0c8249634d8fcf1a685571f9","observation_id":"798d43d2-91fb-4ad5-8c88-5000b2d23e75","resolution":{"observed_at":"2026-08-10T18:11:50.674344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.620893Z","title":"Beyondbench: Contamination-resistant evaluation of reasoning in language models","venue":null,"work_id":"f15e34cc-95c7-4c1a-9d17-447e43f146a7","year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.677929Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:b5de7304e883fef7f549e44382668a3a87bb1bab7a689b7cae75b024f6cbb8b0","observation_id":"04dfdb9b-58a3-443b-b82c-a91d05bb4d86","resolution":{"observed_at":"2026-08-10T18:11:51.624628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.610560Z","title":"Debate, train, evolve: Self-evolution of language model reasoning","venue":null,"work_id":"98a37721-c247-47f8-99d8-bd7199f336b4","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.682230Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ba5a161a10a23f07fe227a2f31fceaa6f492285c8bb005a24487623f764ec4f3","observation_id":"84b9f1d0-f9c0-4e3a-8793-3930d68f25c2","resolution":{"observed_at":"2026-08-10T18:11:51.614286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.598186Z","title":"Question generation for adaptive education","venue":null,"work_id":"5d17c001-3f83-45dd-9e11-482c6ca7b1f6","year":2021},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.685714Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:383a5b2c489a24de39aa124d9e6f04cf67ab91e2272c852f75473061df55581d","observation_id":"7b02d0c2-6db0-42b1-b74b-4e51bc486618","resolution":{"observed_at":"2026-08-10T18:11:51.603605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18880","last_updated":"2025-06-23T17:51:40Z","snapshot_observed_at":"2026-08-06T23:12:46.021492Z","submitted_at":"2025-06-23T17:51:40Z","title":"OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18880","snapshot_observed_at":"2026-08-10T18:11:50.688938Z","title":"Omega: Can llms reason outside the box in math? evaluating exploratory, compositional, and transfor- mative generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.688938Z"},"links":{"cited_paper":"/paper/2506.18880","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:1920c2859e77ffb045a36c6d18aabd598a9983bfc9e04ce3a6fa585f3144fc35","observation_id":"e3115606-8d7d-4b7a-9c8c-e296f1eaddaa","resolution":{"observed_at":"2026-08-10T18:11:50.688938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.692728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.692728Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:52f4bb79c866bd11059dbb8bc0b8ad824966ca24c4cb85a35f2dc1303991149d","observation_id":"2fdd5fdb-76be-4f82-a8d9-9af7c4efd273","resolution":{"observed_at":"2026-08-10T18:11:50.692728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.581971Z","title":"Learning to ask: When llm agents meet unclear instruction","venue":null,"work_id":"a2c0e70d-689f-48a0-a84a-703cef09977e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.696110Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:c1f2e29fd69a773ea3f7f1e680c8dbeb5f2475e0b0a686ee4b13c6ae1ce6de74","observation_id":"cef34fe4-036b-4eb9-b6c4-173021f42e1b","resolution":{"observed_at":"2026-08-10T18:11:51.585605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.571581Z","title":"Qg-net: a data-driven question generation model for educational content","venue":null,"work_id":"23ba4f7b-b707-4bc6-b160-fb94a8a34cc8","year":2018},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.699893Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:e3abc9f42d9da26df7a241578ea406e87f215d1c10478885c4145e6193311f9a","observation_id":"e86daf76-c118-47aa-a152-9bd2abd175f4","resolution":{"observed_at":"2026-08-10T18:11:51.575074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T18:11:50.703480Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.703480Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:1d6c243b8af0c1807d4ac7521e531ecc1c3c62f6c4a6a1f1d63d7da00a19e16c","observation_id":"3827a995-fe82-479f-827c-fad9aa34672a","resolution":{"observed_at":"2026-08-10T18:11:50.703480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00839","last_updated":"2026-05-12T22:28:40Z","snapshot_observed_at":"2026-08-04T20:52:44.966486Z","submitted_at":"2025-11-02T07:42:51Z","title":"CodeClash: Benchmarking Goal-Oriented Software Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00839","snapshot_observed_at":"2026-08-10T18:11:50.707243Z","title":"Codeclash: Benchmarking goal-oriented software engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.707243Z"},"links":{"cited_paper":"/paper/2511.00839","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:e8cfeb6490e7ec5da9f80fdf37fba8a380016d430247187c18e23e628f05a3a9","observation_id":"332e910e-b7a3-4796-8889-a5c479063466","resolution":{"observed_at":"2026-08-10T18:11:50.707243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.712039Z","title":"Spell: Self-play reinforcement learning for evolving long-context language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.712039Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:168318329217cb5835a3f82e82d4b130f2751b1314928d0c33fa445f0ce62012","observation_id":"6f4e9e39-805f-47c8-8735-de2c4b13afd7","resolution":{"observed_at":"2026-08-10T18:11:50.712039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.560386Z","title":"Self-rewarding language models","venue":null,"work_id":"180fd2f3-bf11-4492-ba01-87e96279fc39","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.715890Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ff4b4ea312d3b0badf24e68d6eb3396659403c54a5a41ff1d87b7a2dbe4c8e4b","observation_id":"db137e58-d118-44bd-8737-4d70c5a4cf97","resolution":{"observed_at":"2026-08-10T18:11:51.564988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-10T18:11:50.719307Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.719307Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:3ee4738f17b40747a567332188b2e01f13556f14fb5eb95dcae103236f8a569e","observation_id":"305a8755-5e38-4b90-a0f2-82ade91e0d16","resolution":{"observed_at":"2026-08-10T18:11:50.719307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05252","last_updated":"2025-02-07T17:05:25Z","snapshot_observed_at":"2026-08-09T01:20:28.151253Z","submitted_at":"2025-02-07T17:05:25Z","title":"GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05252","snapshot_observed_at":"2026-08-10T18:11:50.722837Z","title":"Gsm-infinite: How do your llms behave over infinitely increasing context length and reasoning complexity? arXiv preprint arXiv:2502.05252, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.722837Z"},"links":{"cited_paper":"/paper/2502.05252","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:61db2a0e8c8b7d61eb1fe854ce2cfea4a4554b70b19e084d4eb6e3f52bea49ad","observation_id":"10e9ff3b-cd70-42d8-837b-aec9cd89632d","resolution":{"observed_at":"2026-08-10T18:11:50.722837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-08T18:43:29.715488Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-10T18:11:50.726572Z","title":"Dyval: Dy- namic evaluation of large language models for reasoning tasks.arXiv preprint arXiv:2309.17167, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.726572Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ef88782adfa1949633f97c4a1d592cf337590e03ae97339445835f26c830b54f","observation_id":"8a1ffbb2-14d1-4c9c-96a8-296db5c6fda7","resolution":{"observed_at":"2026-08-10T18:11:50.726572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.548879Z","title":"Twinstar: A novel design for enhanced test question generation using dual-llm engine","venue":null,"work_id":"3237d7a2-74d0-4084-947a-fc922a6fc51c","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.730185Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:e5e3f44b1d95be09250b63f489751ee4771d06bd66f8d2588f83783ab083df16","observation_id":"e6014fca-27b9-49a8-a167-f13dd9541fe1","resolution":{"observed_at":"2026-08-10T18:11:51.552784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.538189Z","title":"no solution","venue":null,"work_id":"36c6f899-24bf-49e1-bc8e-5604b8195a53","year":2022},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.734271Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:f421200a212ee0da37a67ab621ab04f8c5bcab1cbae0776f1e6a735b6b936705","observation_id":"3f023ab3-82ef-463e-95ad-277d9990bd64","resolution":{"observed_at":"2026-08-10T18:11:51.541583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-11T02:55:09.052138Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-08-10T18:11:50.555244Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.555244Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:10c02ca71a4b5a3959b84760bfac7850727b31eadd3714931b1f79e37945e7cc","observation_id":"4b95facc-b5c9-4eab-b082-ebfa1f38030c","resolution":{"observed_at":"2026-08-10T18:11:50.555244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T08:10:31.740549Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2608.06933."}