{"as_of":"2026-08-10T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b393de8560194fa395ec6e4fae6c5efb3b47dcd37f0cc4007506da3a96d994b","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:07:03.928169Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T12:24:33.998226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T12:26:16.710584Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"cited_work":{"arxiv_id":"2508.11252","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11252","snapshot_observed_at":"2026-07-09T12:26:16.710584Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","venue":"cs.AI","work_id":"9e81f7af-8636-4e59-9c2c-5accbbcf1508","year":2025},"citing_paper":{"arxiv_id":"2607.07391","last_updated":"2026-07-08T13:23:56Z","snapshot_observed_at":"2026-08-05T00:47:41.388747Z","submitted_at":"2026-07-08T13:23:56Z","title":"MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-09T12:24:33.998226Z"},"links":{"cited_paper":"/paper/2508.11252","citing_paper":"/paper/2607.07391"},"observation_digest":"sha256:087cbb1047cb67138d530cf3b589eb72c301bf3f35ab9f8739b94aa2ccb038ba","observation_id":"aa4ce1f3-3f5a-44b5-9695-194bfd0ae40b","resolution":{"observed_at":"2026-07-09T12:26:16.711939Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11252/citation-record","integrity":"/paper/2508.11252/integrity","json":"/paper/2508.11252/citation-record.json","paper":"/paper/2508.11252"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.632919Z","title":"van Eemeren, Rob Grootendorst, Sally Jackson, Scott Jacobs, Agnes van Rees, Francisca Snoeck Henkemans, Eveline T","venue":null,"work_id":"e7ddc196-d42d-474f-9e1d-7eecb29d5f07","year":2001},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.190648Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:692c5abed0e3e41e016cecb1c70a4fe9dfb6cd0d2402d77923f9fa0502ac15a7","observation_id":"46e93cf4-032b-4c97-b851-e926fb5e3dd1","resolution":{"observed_at":"2026-08-05T20:07:12.728559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.535458Z","title":"Dictionary of philosophy","venue":null,"work_id":"d6901451-863c-4799-9737-5aee0e32fbe4","year":1981},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.245217Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:0c49e6bbd11a06224e9fd92e17902793eedbbad422c8913bb8cfc933848b9101","observation_id":"a76876a4-59e5-4133-aee0-4ae45c21033f","resolution":{"observed_at":"2026-08-05T20:07:12.581522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.440326Z","title":"McCarthy and P.J","venue":null,"work_id":"1a5d8465-3a73-4143-8242-f12fb7d0a9d1","year":1981},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.394610Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3c64d5f40655c705ebf24e610866eb6be2220eb9053ba190c8c060e5c47dac51","observation_id":"370b6277-7626-4223-a4a4-8ce3fdf716b4","resolution":{"observed_at":"2026-08-05T20:07:12.484770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.312573Z","title":"Programs with common sense, 1959","venue":null,"work_id":"5b3b9c67-b6ff-4142-a593-c025eae2b83a","year":1959},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.500892Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:4b524ec5a9b6d69dcb04cbd13350438650aa8aa2bbccc69a340e6797309b8264","observation_id":"6283a7de-d9c5-4213-92df-a28911622977","resolution":{"observed_at":"2026-08-05T20:07:12.356361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.213919Z","title":"Newell and H","venue":null,"work_id":"e2cf4075-cf91-4e24-a856-845ca3f51c7a","year":1956},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.644951Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:e884b65e3f373a9755bf6fc543d5fff597af5531b2a835195259b2df59f9e807","observation_id":"b63c295f-3367-4fc6-8bdf-0d54e7e06fae","resolution":{"observed_at":"2026-08-05T20:07:12.262508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T20:06:58.787169Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.787169Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b9cee03e9c978ba9c47c9f559853c160bf6f57810d8c5074328a61fc91430ed0","observation_id":"7bd09b23-7d48-4ca8-99bf-aa9a9404c831","resolution":{"observed_at":"2026-08-05T20:06:58.787169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:06:58.934923Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.934923Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:489c9a15d44c66cb215fa24852c639caa3a55dd58a3dd67f204bc63ba5daff53","observation_id":"98a098ea-9d90-4b3d-b421-de3ddcb3e9bc","resolution":{"observed_at":"2026-08-05T20:06:58.934923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.086930Z","title":"2024 aime i","venue":null,"work_id":"f278da5b-8b54-409e-99da-de7adc1e35b7","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.038089Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b8a7973381747af6b4be770dbe21e0739a3e231900ed95c5d9f1e3bcaf2ddf1c","observation_id":"7e1b6ea8-3138-4a37-98bf-503e9607f5b3","resolution":{"observed_at":"2026-08-05T20:07:12.165657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.990625Z","title":"Let's verify step by step","venue":null,"work_id":"1c1f5c09-ed10-4a7c-92e6-ce71bb199f0e","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.117727Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:950fb068ed97e0b33c90eb520db15953054b51fccbd05f6595db6d7eb89e1164","observation_id":"7a53f98a-62bf-43f9-9a55-9e3c0cc643d0","resolution":{"observed_at":"2026-08-05T20:07:12.035357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.882840Z","title":"Omni- MATH : A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":"cd6ec29f-6340-4fed-8620-3984f40cea5f","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.214909Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:df6a32f302b7c793222a131fa41c8ab2736b191a26c567f9b56506c3e425329b","observation_id":"eba0e665-bb2d-4ed3-903f-c5887baf8f86","resolution":{"observed_at":"2026-08-05T20:07:11.949130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:06:59.358545Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.358545Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:fcba9f443c74fc3736810a5bb9b2c0bca307332f00a69ab3c41d4e01567b0da3","observation_id":"6cf53a6a-4452-4e61-bc37-4641b64d79ce","resolution":{"observed_at":"2026-08-05T20:06:59.358545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.698415Z","title":"Clamber: A benchmark of identifying and clarifying ambiguous information needs in large language models","venue":null,"work_id":"82bea7d9-2467-4abe-8927-c2cc5feddca3","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.465558Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:0f25141f2c69e6d40f0a5eb02acdc804d7f6234cd832b57bfca99979774a422b","observation_id":"df75b3d2-5714-4907-8b0e-f846dab3f8c1","resolution":{"observed_at":"2026-08-05T20:07:11.794651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.604855Z","title":"Rethinking conversational agents in the era of llms: Proactivity, non-collaborativity, and beyond","venue":null,"work_id":"b20de20a-7300-4185-8db2-14e237bbd8fb","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.574990Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:922cc810980be732aa04397a43c96746181d53248e40ad6d493b59d8097a5fa5","observation_id":"386b49d3-e878-442f-84cd-25f37252c31a","resolution":{"observed_at":"2026-08-05T20:07:11.649126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:06:59.670963Z","title":"Li, Been Kim","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.670963Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:4aeccfe44c645a697052768fc35351070ec0ca993902fc70f77479ed70baf0c6","observation_id":"fd0d4cff-1480-45c6-b34f-09197e4f2f9a","resolution":{"observed_at":"2026-08-05T20:06:59.670963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.486505Z","title":"Reasoning attack: Inducing llm to never-end thinking, 2025","venue":null,"work_id":"a4a8cc30-04f4-4b68-8e97-fd94f37d624b","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.756678Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:1a5c9c0ab91f139a94d4ab1a99f446eff9fbd176eeaad87afc1d6e121aae7513","observation_id":"d640403b-1be5-469e-ae88-de6dbf05c71f","resolution":{"observed_at":"2026-08-05T20:07:11.542959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.258911Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"7b426806-1127-4883-805d-0755171b0fa5","year":2022},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.850459Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3c64cb658947d39e53061db1ded717edba82671e288a7e67ab19e3ba633e050f","observation_id":"7919619a-e362-4901-8965-1a66dc01ce8c","resolution":{"observed_at":"2026-08-05T20:07:11.417146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T20:06:59.954946Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.954946Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:2df1be87559797cfd33adce9186d784063f678afe3097e115b031c5a44b8e762","observation_id":"8ae85c5a-de73-456d-9582-33f2c95668a5","resolution":{"observed_at":"2026-08-05T20:06:59.954946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.845227Z","title":"Bespoke-stratos Labs","venue":null,"work_id":"c2bd6e06-c6da-4230-9d3a-4190b8c865f5","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.050629Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:9807db1a65ec7ee296a84821ddfb7067a8b1ccac877f7597fc2766ea4b286c96","observation_id":"812c533b-10ff-4c3b-aeff-60ba40608fcd","resolution":{"observed_at":"2026-08-05T20:07:11.112782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T20:07:00.139772Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.139772Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f75d0abbccb0a2ec390aa76d2f37f0d66a2d381cf0d064ef950eba9c55e74a60","observation_id":"0855451a-dbc2-4725-a890-92e160cdfdac","resolution":{"observed_at":"2026-08-05T20:07:00.139772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T20:07:00.246609Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.246609Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:bd40dbf17b66661222cbaf2edf3b0612cac7575a6eb40ac25ddadd1cf5b10775","observation_id":"925a3393-d92f-4266-af04-2f787ab03547","resolution":{"observed_at":"2026-08-05T20:07:00.246609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.489282Z","title":"Sky-t1: Train your own o1 preview model within \\ 450","venue":null,"work_id":"f2b92430-5b69-41f9-93df-b4e1f00c2bdd","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.355608Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:8f2182e145798514dd2ab7f9177e1ce258b636031507feeca88de6706496d302","observation_id":"2e340aae-809c-4196-9127-57d204cb4abe","resolution":{"observed_at":"2026-08-05T20:07:10.674559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-05T20:07:00.485136Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.485136Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ef606feb7a9ce4977ebe5edd34c40a9e389014c61b01bbe097d03bd21c5fa2cd","observation_id":"1543a353-e86a-4853-b45d-d8927b37cbc1","resolution":{"observed_at":"2026-08-05T20:07:00.485136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.308487Z","title":"Qwen3: Think deeper, act faster","venue":null,"work_id":"15460222-9cd5-455b-9da9-0f0d070767f0","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.591595Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:89adedcd0c801b1e32235615ea294505e62e6b570e10b815eb0b630193c35230","observation_id":"683f945d-43e1-4346-ae69-9d6eb0b96bd3","resolution":{"observed_at":"2026-08-05T20:07:10.365162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.124937Z","title":"Claude 3.7 sonnet and claude code","venue":null,"work_id":"5cbe4c0b-86ee-420f-85a5-e1fd9359a673","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.699335Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:97c55ecd37a5515bdee789c39e360a518f19970fd9a4fa33eee15ec00817b599","observation_id":"b74a40ff-1242-4935-853b-dae7802d9374","resolution":{"observed_at":"2026-08-05T20:07:10.221580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.942937Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"0ae9cf08-07a4-459e-a4d6-22a5730d393d","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.778952Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:21edf6c80b2e2fbcc7a0a8bbb3a81402148d8b2305ff06de38f4e255bcb85e3d","observation_id":"717194d9-c392-4cae-a616-9d30993f1c48","resolution":{"observed_at":"2026-08-05T20:07:10.033377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T20:07:00.871004Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.871004Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:180dfb2a5d325e617c24c0b49fe829839e8f80c1ce1f1e64600ec19a25e942ab","observation_id":"feb82631-4813-4c5b-9148-414021f9a9b6","resolution":{"observed_at":"2026-08-05T20:07:00.871004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-05T20:07:00.983996Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.983996Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5850d4ba05e9c8cd4710c355b4f9f218ff1f87e1df4ff8d3fe4a5923e53b1d2a","observation_id":"fde7b267-3a0b-473f-a97e-4fb6b5eca28a","resolution":{"observed_at":"2026-08-05T20:07:00.983996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T20:07:01.076649Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.076649Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f48895edaab8a5ed1f9e714f89846feefff47d8f1ef060b472c1e97a1586b9cd","observation_id":"82397fd9-be3f-4701-be79-d949ae8adcb3","resolution":{"observed_at":"2026-08-05T20:07:01.076649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-05T20:07:01.215034Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.215034Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:813cd0c97261b1bd323e328ef1884bda420ff30cb84943f3b17f5415e2178acf","observation_id":"35fa5a0e-da24-46bb-8174-0f646ff6a458","resolution":{"observed_at":"2026-08-05T20:07:01.215034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.763106Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":"e073b433-bde3-4379-a2f4-b570f6ababde","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.280601Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:08040e82913cfdb0fc13778c8b871cfe5b85d47ad6b70c9173fa29cabc41d5b8","observation_id":"3bba2630-f867-4ec9-8945-ab843d9d2d02","resolution":{"observed_at":"2026-08-05T20:07:09.852083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.545964Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"a1841366-a74b-49b1-9f88-8925727dc8d0","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.363095Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5921ba2ebb64efb467fa5cfdc6b95d4fae2167cacbabd06ab9f1c5aaaccf5e5f","observation_id":"f0d8dbf4-632b-46fa-ac4f-dcb6c23728ad","resolution":{"observed_at":"2026-08-05T20:07:09.715437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T20:07:01.454580Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.454580Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5d24c16d8323c650c7dbdf2b1f874670d4470863bbcd9a6b5a2d1bdc4805645b","observation_id":"12ee1f7d-a8bb-4fec-b038-eca99d9085ee","resolution":{"observed_at":"2026-08-05T20:07:01.454580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.286764Z","title":"Math-Verify: Math Verification Library","venue":null,"work_id":"d1ec2dbb-81c3-4113-bea6-0d9c8080e98a","year":null},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.521708Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:07695e13911a7308d8c1f18d787124b48ad719a684e735eee9358677c8083239","observation_id":"83059a89-9761-47af-b6aa-e0b209a60029","resolution":{"observed_at":"2026-08-05T20:07:09.408545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-05T20:07:01.606002Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.606002Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3826b8c8a149b548d9074ab5a33ec3b93f7a590f61f9bc597ba3abe61eb54ae0","observation_id":"40f39d92-e928-4cdb-8c44-b759ec7efc31","resolution":{"observed_at":"2026-08-05T20:07:01.606002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.981228Z","title":"Interference and inhibition in cognition and behavior: Unifying themes for educational psychology","venue":null,"work_id":"7e2b0bc3-2400-451a-9014-d7891df77a55","year":1999},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.695399Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:a30d501fd8d5ba51d28abc658e081143129866c8cad8997be44a38807f986508","observation_id":"1136c703-50c5-466f-b7ff-b7b6b98446e0","resolution":{"observed_at":"2026-08-05T20:07:09.160064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.713800Z","title":"How students “unpack” the structure of a word problem: Graphic representations and problem solving","venue":null,"work_id":"df592285-0455-4592-9f45-5d30303fb9e1","year":2008},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.788385Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f3af5de059341b79c240f472906de9958cc3af268d6ac550a8a7164c54b31659","observation_id":"3bc7e2fb-86f4-4f89-83d1-2ae4594a183b","resolution":{"observed_at":"2026-08-05T20:07:08.776804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.507542Z","title":null,"venue":null,"work_id":"c9cc4eb2-566d-40d8-b377-2b24790ffef3","year":1989},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.852303Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ef97899e2dba3ef1d5301d4fd92c464c67b0a17dbc5e63296c726cf235df912f","observation_id":"dac55333-c023-47e4-ad17-4d65f1ebac92","resolution":{"observed_at":"2026-08-05T20:07:08.606236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.312988Z","title":"Metacognition: A literature review","venue":null,"work_id":"4582ea87-01d0-44fe-aa4e-34c2bb55c8d2","year":2011},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.936919Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:a954825275e607c73a3d085aa12cceb28cc26059c01b0ab6f23752209ee7d088","observation_id":"8d60990c-3ea2-4a7e-8f74-550313053840","resolution":{"observed_at":"2026-08-05T20:07:08.406532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.075405Z","title":"Strategies for improving learner metacognition in health professional education","venue":null,"work_id":"b99073ab-ab55-4860-ae75-685727589aa7","year":2017},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.995855Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:4a12134c702b4f7d76b0c0c8d7953f458fe8749cafda6666253a2d904aff7b98","observation_id":"cca27954-eebb-4e8a-a7d4-d7c8fe423332","resolution":{"observed_at":"2026-08-05T20:07:08.210450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T20:07:02.080403Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.080403Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:9f39496257021b6350fb73c55076fa028608ed531e73086e85b93d6c38eac3f2","observation_id":"ef5d890e-0c43-4392-8c98-7ca9a231aada","resolution":{"observed_at":"2026-08-05T20:07:02.080403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.871747Z","title":"A survey of deep active learning","venue":null,"work_id":"c31582d5-2814-4d6e-96a7-a72a56eb12ee","year":2021},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.145598Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:beaf6caced30403b80f2d27a1b47fe09fb06697a60528bab075313f6a5537113","observation_id":"62942cf8-05e8-44b3-9002-0c9956cc902c","resolution":{"observed_at":"2026-08-05T20:07:07.968999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.680615Z","title":"Deep bayesian active learning with image data","venue":null,"work_id":"aa7d1d77-b63f-4e93-835b-4d820ee288d7","year":2017},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.234196Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:39da66275e6dea591d48ebe4b51e4dbd5bb554a9efae286917ad73c5f0dc1003","observation_id":"9bf6058f-c77c-4194-a102-3fd4beb95319","resolution":{"observed_at":"2026-08-05T20:07:07.796796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.451481Z","title":"Reinforcement learning: An introduction , volume 1","venue":null,"work_id":"7905c056-dcb5-4a3d-b253-dac8d32fafa4","year":1998},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.310110Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ce8ffa0c04e32f608a52071ecba240f3795ba14dfad338a18dfe3f7a9a72c5b4","observation_id":"ad39eb8c-7773-4d34-98e3-5954f177a0a4","resolution":{"observed_at":"2026-08-05T20:07:07.562472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10454","last_updated":"2024-10-06T17:34:15Z","snapshot_observed_at":"2026-08-04T06:52:01.276654Z","submitted_at":"2024-03-15T16:42:14Z","title":"Partially Observable Task and Motion Planning with Uncertainty and Risk Awareness","version":2},"cited_work":{"arxiv_id":"2403.10454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.10454","snapshot_observed_at":"2026-08-05T20:07:04.234671Z","title":"Partially Observable Task and Motion Planning with Uncertainty and Risk Awareness","venue":"cs.RO","work_id":"07e1847d-d113-46b9-9014-3481873fc142","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.384922Z"},"links":{"cited_paper":"/paper/2403.10454","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3cb2313c22637e2203f4dd15fbff1a4e5d30e8b44ee28ddb9611de0d6a8c560b","observation_id":"c52c2a08-ece9-4395-8a33-e350216a0313","resolution":{"observed_at":"2026-08-05T20:07:04.307527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.221792Z","title":"Combined task and motion planning under partial observability: An optimization-based approach","venue":null,"work_id":"c210b8ce-f1b4-44ad-a250-af024bc4c6d5","year":2019},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.475798Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:bb53576f17694973ff6f7bbd4c6d54573b65129a8eae62316715684c7e9f3952","observation_id":"7e5facde-f8c8-4345-b778-7db9d575b6f1","resolution":{"observed_at":"2026-08-05T20:07:07.331095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.996456Z","title":"The communicative function of ambiguity in language","venue":null,"work_id":"08c0ebbe-5579-4494-ae45-5a81a55d2b96","year":2012},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.560443Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:437621d764dc651725937c3175ad01c0cf34494cab1deb256ee31333eb7422d7","observation_id":"0b1c7b4b-5a4b-45aa-b921-d6890b2a258b","resolution":{"observed_at":"2026-08-05T20:07:07.103378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.833504Z","title":"The puzzle of ambiguity","venue":null,"work_id":"a0743c31-dfe8-4052-b975-b57bc5ad0f60","year":2005},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.645566Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:29d729fe1109b34ee08cef990a04ce6590556f0220483ca1bbd61bc6f93fc10e","observation_id":"9e8c9df5-a049-484b-b03c-fb9c513cac9d","resolution":{"observed_at":"2026-08-05T20:07:06.910037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.629310Z","title":"Semantic ambiguity within and across languages: An integrative review","venue":null,"work_id":"ad63ebe3-1d3a-49e1-a820-66272dd7bca4","year":2010},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.733138Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:c548b231acebcbac867889e59269b04be2f61242569ae6da48674d542e0261ed","observation_id":"43c56b16-8780-4f11-87bb-f1f8ff5ba0ad","resolution":{"observed_at":"2026-08-05T20:07:06.715372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.365437Z","title":"What computers can’t do: The limits of artificial intelligence","venue":null,"work_id":"7cf74921-2d9c-47a4-bb06-f728da7bb017","year":1972},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.816955Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5f0450b0d276e15ff39559e0c7be8bf8a017f4cf49f2e8d66dc56edc0d836992","observation_id":"996c406a-4b06-4770-86ac-2fc167ea365f","resolution":{"observed_at":"2026-08-05T20:07:06.478269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T20:07:02.902944Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.902944Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:7c2ccf986deeabe689606fc0b263f4f76e79e74eb776baadea3532d732fa4805","observation_id":"e0f6b72d-cb2b-44a1-a86b-39d5e21a3c38","resolution":{"observed_at":"2026-08-05T20:07:02.902944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05714","last_updated":"2025-05-22T05:58:23Z","snapshot_observed_at":"2026-07-06T20:19:02.999488Z","submitted_at":"2025-01-10T05:15:14Z","title":"How to Enable Effective Cooperation Between Humans and NLP Models: A Survey of Principles, Formalizations, and Beyond","version":4},"cited_work":{"arxiv_id":"2501.05714","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05714","snapshot_observed_at":"2026-08-05T20:07:04.073932Z","title":"How to Enable Effective Cooperation Between Humans and NLP Models: A Survey of Principles, Formalizations, and Beyond","venue":"cs.CL","work_id":"47c90e43-4793-4bf6-bff6-3091109a26ca","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.991235Z"},"links":{"cited_paper":"/paper/2501.05714","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:e5d02a378f35ad69bf8cc35ef6a3fd15bdd97778be90aa9b7cabc20291638d87","observation_id":"bce34754-5435-49c7-85d1-d7eeed121372","resolution":{"observed_at":"2026-08-05T20:07:04.127404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.147976Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation","venue":null,"work_id":"e2bac9b1-c5da-4966-9a3c-a20430a2499d","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.077429Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f43862bc2b3f79dfce39c354cd90fcc2efac94906aeae6c0652a437335dea7ca","observation_id":"21861de3-46da-4924-a50a-962d68c5d7e7","resolution":{"observed_at":"2026-08-05T20:07:06.214899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10645","last_updated":"2020-10-05T03:28:21Z","snapshot_observed_at":"2026-08-10T00:47:33.544216Z","submitted_at":"2020-04-22T15:42:13Z","title":"AmbigQA: Answering Ambiguous Open-domain Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10645","snapshot_observed_at":"2026-08-05T20:07:03.139186Z","title":"Ambigqa: Answering ambiguous open-domain questions","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.139186Z"},"links":{"cited_paper":"/paper/2004.10645","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:e37bc3b9b21dd2bfb6d0b8ee56300506a906f8f1220afe0dbf109d58e54c4764","observation_id":"5f92a559-b612-4dcf-bfbe-2adab9850b45","resolution":{"observed_at":"2026-08-05T20:07:03.139186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09911","last_updated":"2024-06-16T15:24:12Z","snapshot_observed_at":"2026-08-04T04:35:24.086370Z","submitted_at":"2024-04-15T16:35:41Z","title":"ChatShop: Interactive Information Seeking with Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09911","snapshot_observed_at":"2026-08-05T20:07:03.226004Z","title":"Chatshop: Interactive information seeking with language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.226004Z"},"links":{"cited_paper":"/paper/2404.09911","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:8b1443adcc188e849e1e1ba8df76df13974fc65a258a51b08b2080215f6acc33","observation_id":"38ffefd5-7b95-41c5-ab5a-a093a90e3186","resolution":{"observed_at":"2026-08-05T20:07:03.226004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.783526Z","title":"Style: Improving domain transferability of asking clarification questions in large language model powered conversational agents","venue":null,"work_id":"7daf5279-9cd7-44d6-9d91-c45cf58919bd","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.313584Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:6b01715d740511d02c3754ff692fc7661080c7fe88209ce553999e0528af379e","observation_id":"101e6db0-1c75-4f15-974e-b079df9cc900","resolution":{"observed_at":"2026-08-05T20:07:05.933634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.579578Z","title":"Prompting and evaluating large language models for proactive dialogues: Clarification, target-guided, and non-collaboration","venue":null,"work_id":"2cadfe9f-fc08-415a-98a9-c53d002ac40e","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.400260Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:27c41acdb46e3e8157fa584b7a4ecf154006dca1baf499f3c35a79be0e48a310","observation_id":"f12f2614-8b02-43aa-92f8-4ceff6d62045","resolution":{"observed_at":"2026-08-05T20:07:05.688837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07769","last_updated":"2023-02-20T11:19:08Z","snapshot_observed_at":"2026-08-08T11:25:49.765781Z","submitted_at":"2022-12-15T12:47:18Z","title":"CLAM: Selective Clarification for Ambiguous Questions with Generative Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07769","snapshot_observed_at":"2026-08-05T20:07:03.485390Z","title":"Clam: Selective clarification for ambiguous questions with generative language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.485390Z"},"links":{"cited_paper":"/paper/2212.07769","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b7182db184ad71cc183548793bbe70d1bb892edecf244b0658c2d094b5e3cd7c","observation_id":"6f8c9949-2158-486e-a38a-f15f06fbbb6c","resolution":{"observed_at":"2026-08-05T20:07:03.485390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.368597Z","title":"Selectively answering ambiguous questions","venue":null,"work_id":"f8e1156e-ce04-4d5e-a1d2-ff0e7a828755","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.576713Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:c77a38cd51db0d4faa1971e60a6c6cef0b1570f3497bea3eb81e1b7077427490","observation_id":"558401d8-0e9d-4913-820d-01f876df472e","resolution":{"observed_at":"2026-08-05T20:07:05.482114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.152022Z","title":"Multiwoz-a large-scale multi-domain wizard-of-oz dataset for task-oriented dialogue modelling","venue":null,"work_id":"7322e635-195a-4802-a5d1-41febe9c4328","year":2018},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.656980Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ce06a627f75b4389c9a63e05dfc0ec2d88450a2c130777fe10ea8b523dec9c29","observation_id":"7805dadc-569b-4275-8b6a-582e6b7a74dc","resolution":{"observed_at":"2026-08-05T20:07:05.242301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:04.930959Z","title":"Towards scalable multi-domain conversational agents: The schema-guided dialogue dataset","venue":null,"work_id":"1bf37b07-7cc5-4381-ab0a-b46a5dd91f78","year":2020},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.743739Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3b72819b6b3e88cc2a7570fc18be33e04461c01b366ead49d680fe2afcc39dbb","observation_id":"4a57f24e-63db-4e72-9e29-27f8ff31b604","resolution":{"observed_at":"2026-08-05T20:07:05.020669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:04.720051Z","title":"We need to consider disagreement in evaluation","venue":null,"work_id":"bfcafdec-7e9f-466d-a790-70d01705edc1","year":2021},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.839908Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:74335148c795703b096cba787da9f2f538f01b1db38f279c926aa7fe76a6c3a7","observation_id":"9ac5de61-2202-48e8-8946-673f04381adc","resolution":{"observed_at":"2026-08-05T20:07:04.803185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:04.594880Z","title":"Everyone’s voice matters: Quantifying annotation disagreement using demographic information","venue":null,"work_id":"d09dbbc6-256e-4c9e-98d0-2fc68ebc819e","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.928169Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:947ff4d87bee563415c34bba769a342a17a8e70f1adb94d98a2bfc8974589710","observation_id":"9b8e2b2c-3d43-4e59-8cac-9a8b70c433bb","resolution":{"observed_at":"2026-08-05T20:07:04.664550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":40},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2508.11252."}