{"as_of":"2026-08-09T07:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b7f29c955310d50266836fb986430d343dd23ee30fb78e8ede70f81a283c06b","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:17.785500Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:24.782504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:27:24.497080Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-08-07T12:59:24.782504Z","title":"https://doi.org/10.48550/arXiv.2505.22113","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22987","last_updated":"2025-07-17T20:04:13Z","snapshot_observed_at":"2026-08-08T02:09:32.171416Z","submitted_at":"2025-05-29T01:51:20Z","title":"Strategic Reflectivism In Intelligent Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.782504Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2505.22987"},"observation_digest":"sha256:2e39cc3696aa429bbd7a5fe517524b58b10c184957e45a22cc9a938bc98f087f","observation_id":"a4fcd218-24f4-4bd3-89f4-9ed46bc3b58e","resolution":{"observed_at":"2026-08-07T12:59:24.782504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2507.04023","last_updated":"2026-04-23T08:06:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-05T12:31:17Z","title":"Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T06:25:12.799097Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2507.04023"},"observation_digest":"sha256:17aa336166f9c3c0609d9bb9b235052c2db474669b60c826a5fe24eb7b100bb2","observation_id":"fcf09946-aa25-42e3-84b2-db2d72a9a230","resolution":{"observed_at":"2026-05-19T06:27:07.313600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-08-06T17:54:17.162463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.162463Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:984e93c43005ff08d95a2c3a2c4503072c9385bcf1eb03589e43f56311ec9be5","observation_id":"9f5055de-f5b5-42b8-8bc3-4c8f0321b50f","resolution":{"observed_at":"2026-08-06T17:54:17.162463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2511.23253","last_updated":"2026-05-17T14:28:57Z","snapshot_observed_at":"2026-08-02T03:33:31.761191Z","submitted_at":"2025-11-28T15:02:19Z","title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:42.921867Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2511.23253"},"observation_digest":"sha256:db3d11552004b81f6289c190da63747fd043bfef7628ce4feb153cb2308b0ea1","observation_id":"3753c99a-84be-4992-9af0-af1dace88f70","resolution":{"observed_at":"2026-05-21T18:00:26.865491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2604.12214","last_updated":"2026-04-14T02:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T02:48:29Z","title":"Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:18:42.321975Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2604.12214"},"observation_digest":"sha256:f883d5a2502d6b5fbe0f0f5161f6ea647b20eebb12b7484d4f3cfe3764d1f3e8","observation_id":"823da83a-998a-40b9-9eb6-47c105ff82a4","resolution":{"observed_at":"2026-05-11T10:46:06.021781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-02T10:20:40.458806Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:7a73df36eeb9eb6e55637c3c31cffdd426f7d97c269a19f007c6fe3908be83dc","observation_id":"f24ec194-6adf-4669-a666-cc30c21e49b5","resolution":{"observed_at":"2026-05-11T16:31:09.086035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2605.14084","last_updated":"2026-06-09T19:01:29Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T20:09:35Z","title":"CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T04:45:39.641535Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2605.14084"},"observation_digest":"sha256:e00429655e305aa2de32d6711f1553c736544fb6d8074861991811d6f8670e9d","observation_id":"c7bc5be2-94be-4ac2-a0a3-5254c7bb8527","resolution":{"observed_at":"2026-05-15T04:49:44.557913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2605.14084","last_updated":"2026-06-09T19:01:29Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T20:09:35Z","title":"CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T21:12:37.353935Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2605.14084"},"observation_digest":"sha256:f13f59e00d0a4cabb323d861a1050d09594d067b73cd137271b428892f6d9dd0","observation_id":"c28731c9-63ec-462c-a515-ebf21fbfbbb2","resolution":{"observed_at":"2026-06-30T21:15:04.194995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2606.07968","last_updated":"2026-06-06T03:52:27Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T03:52:27Z","title":"RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T19:45:30.671490Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2606.07968"},"observation_digest":"sha256:59f8cec1da791e8d15fe032c3eee6426e185a123f732e52a28b4413f89458c87","observation_id":"1243446f-35a8-45ae-9684-bb4a006b1d33","resolution":{"observed_at":"2026-07-02T21:27:24.499140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.22113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22113","snapshot_observed_at":"2026-07-02T21:27:24.497080Z","title":"Think-bench: Evaluat- ing thinking efficiency and chain-of-thought quality of large reasoning models","venue":null,"work_id":"1eb7cd22-ed7f-48ef-be86-59775a274675","year":2025},"citing_paper":{"arxiv_id":"2606.29067","last_updated":"2026-06-27T19:56:55Z","snapshot_observed_at":"2026-08-05T18:15:40.143418Z","submitted_at":"2026-06-27T19:56:55Z","title":"ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T09:23:26.386399Z"},"links":{"cited_paper":"/paper/2505.22113","citing_paper":"/paper/2606.29067"},"observation_digest":"sha256:e43303adb2f3d7c00bb38e61a44e5ca4dc82f31a6a3157a6deffb3176926db1f","observation_id":"864d426a-3310-4c57-a10c-2c3373f1cc2a","resolution":{"observed_at":"2026-06-30T09:24:32.223129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22113/citation-record","integrity":"/paper/2505.22113/integrity","json":"/paper/2505.22113/citation-record.json","paper":"/paper/2505.22113"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.795279Z","title":null,"venue":null,"work_id":"4cacee50-8792-4013-b6c3-06e7b3b1d5ca","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.730171Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:aede7338888793eb019c0647824596da9871794b264ff840fc91eb96261f05d5","observation_id":"c384100b-c8b7-4d1c-b309-d55a9f9c7178","resolution":{"observed_at":"2026-08-07T13:20:21.917705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.548875Z","title":null,"venue":null,"work_id":"9d22a9d4-ccf3-4155-b3f5-e61ea4be98fd","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.874746Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:3e7ac6f7120b242ea05aaee36aa66142637c3b875ed94b72f89eb3882f8f3cfe","observation_id":"ac1eb0a1-e109-406b-988f-f90903cd7299","resolution":{"observed_at":"2026-08-07T13:20:21.651898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.316635Z","title":null,"venue":null,"work_id":"e120cb3b-0444-45d8-b31d-4d0680046244","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.990072Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:725a1285ab2252686828a520709139d5d4e177d922394be784ad32a4e76ebb2a","observation_id":"93ab8204-0496-486f-bde8-8f826a067208","resolution":{"observed_at":"2026-08-07T13:20:21.425334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:21.038675Z","title":null,"venue":null,"work_id":"9c0b49c3-44fb-44fb-a984-0fa24fa9f84b","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.095136Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:7280873d3c21222e1ae3c6aa4005ff956c5518ad6846dddc60f250ec012d73e8","observation_id":"b24a198a-bec0-47a7-b87b-9f14c1907439","resolution":{"observed_at":"2026-08-07T13:20:21.182153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.828896Z","title":"solution1","venue":null,"work_id":"380c22ad-7ee4-4b74-b4f9-53eaa57152f9","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.203468Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:06603cccb68df2c05f443f4308b978d57543cee60ba7f30c9ac8300253f4d612","observation_id":"e93cbc2c-dc6f-4737-836a-fe532de576a4","resolution":{"observed_at":"2026-08-07T13:20:20.896976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.332107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.332107Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:8ff8167999675b25875ca1cdde5cacffa6101eb6f1e4a002d221cdac815ddfb9","observation_id":"b0690b8e-de93-40a9-ab65-9a913a55ab7b","resolution":{"observed_at":"2026-08-07T13:20:15.332107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.410585Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.410585Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:06caebdcaff7f299cda2cdb3fed7d0e23f3427877c62c26ad12fae215e6219e6","observation_id":"b94e670f-245b-4ca8-b275-77d94a51c5de","resolution":{"observed_at":"2026-08-07T13:20:15.410585Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.623431Z","title":"step_index","venue":null,"work_id":"35f0bb82-bf43-4534-98da-9d797a0c3ca8","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.541578Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:eafbde7ea386e7cbdf54ff0f85674d376dae4d191dfafd3095b0df77033ba1dd","observation_id":"a0f55e05-4ba8-4f10-b81a-5675b489ce45","resolution":{"observed_at":"2026-08-07T13:20:20.723877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.377642Z","title":null,"venue":null,"work_id":"ff9a23f2-2d48-4df9-a0f1-c738a41465f1","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.647111Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:d52247cd23c438b23b57918bc5b583651f4ee8a04d82531da4d26081e7b8df22","observation_id":"8d26cb6c-619a-45ca-9630-2699465649da","resolution":{"observed_at":"2026-08-07T13:20:20.470923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:20.112033Z","title":"correct_answer","venue":null,"work_id":"278bd4a7-b318-4aed-bb24-dd48db59436b","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.714787Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:587951a7b30141c4e39600adef1362d063f267da4aeb45454a2ebe99c74bda07","observation_id":"03e0ef78-1002-4995-902a-e9e024f821a1","resolution":{"observed_at":"2026-08-07T13:20:20.257129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:15.844503Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.844503Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:1ba1de6fe06e65dc8bd5146ea13cb0dce0a684a74b3fffb32587edd8fed0c961","observation_id":"aef9f10d-7f23-4bb8-8aaf-f09ab6276f2d","resolution":{"observed_at":"2026-08-07T13:20:15.844503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.861672Z","title":"Match\": Aligns with ground truth -","venue":null,"work_id":"528dc469-2335-43e4-ac71-59347785161a","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:15.969033Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:73a74181b1bca377f6a261cf7f85602eabf3e63dc40f8ab91fb8ddf41f7b4717","observation_id":"b14553b6-303f-45e2-8cb1-4b2373b2aad6","resolution":{"observed_at":"2026-08-07T13:20:19.984932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.007807Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.007807Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:4da837e8f2cf5c853070645984b11f1c69f89fb1c29438d1f2bade4684767472","observation_id":"8cbf3a86-79be-4057-ae6e-b8ff97544a75","resolution":{"observed_at":"2026-08-07T13:20:16.007807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.097596Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.097596Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:bcb6131fdf7eefd3c2fc7c689ff1e68ae0d10b6a602cf0e3b8c42c9fbd408807","observation_id":"fb0856b0-a0ac-4267-b70a-af6bcb28aae7","resolution":{"observed_at":"2026-08-07T13:20:16.097596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.556829Z","title":"Always include the final step that contains the answer","venue":null,"work_id":"69b3a7b0-c162-4933-bf9f-625d7dd9f800","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.225473Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:7a790e74c90c4b43c5dddbbc2e542217be9715af4747785fc92638e518f9ae7b","observation_id":"40bbb535-5b02-4e5c-af68-02dfae855d04","resolution":{"observed_at":"2026-08-07T13:20:19.720710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:19.337406Z","title":"step_type","venue":null,"work_id":"8b338f97-8fec-4c94-9c12-475d4916befa","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.407694Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:042cafc5b41cd6a506e302ec2f04c3df38d0b4996b516318f4cd918231b06cf2","observation_id":"f4f114d5-2c3a-40ea-8af4-a05d4cd84ba3","resolution":{"observed_at":"2026-08-07T13:20:19.432023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.505667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.505667Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0eb999a363cc225156d04a160df539dbf33da73917d7651e6213e69a46775c76","observation_id":"74c47502-d618-4397-8d1f-e3632be3252b","resolution":{"observed_at":"2026-08-07T13:20:16.505667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.982449Z","title":"19 Invalid reflections include:","venue":null,"work_id":"7d76fabf-c47a-4908-84cb-dc9f721d7fd2","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.674204Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:d7ca83ceaa4d990456d20b3878fed5295407a4c7a2b456f6895186a51a17ffc0","observation_id":"839a257e-a783-4f7a-a736-932603356af4","resolution":{"observed_at":"2026-08-07T13:20:19.156441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.761555Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.761555Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:02777a212446ebe9405b17105400ab1e359fba00c5bee35c07ed57d06d8d915a","observation_id":"ad604f45-77b5-4b0c-819c-8c47d608303e","resolution":{"observed_at":"2026-08-07T13:20:16.761555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.841406Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.841406Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:193e30e9b4dc5beedd7271afb54c56515f854d768e4e3651798d7ca2dc812b19","observation_id":"838ee48d-2e6b-4dcd-8579-6b0d44f19a8a","resolution":{"observed_at":"2026-08-07T13:20:16.841406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:16.934380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.934380Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:3541c608d4b6a98deaaef0461dc655712c8a7440df326d7b6b26ba21f46cd604","observation_id":"72863295-368d-4bbc-90bd-91da3ac42c22","resolution":{"observed_at":"2026-08-07T13:20:16.934380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.577687Z","title":null,"venue":null,"work_id":"8beebad1-ed89-4b9f-b602-e919ffe0a265","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.164581Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:00b8efcb07ca6c2c90abfc3a9daf5488c681542ea6370db7165b16c4af751b30","observation_id":"26672661-3b2d-440b-a9cd-7bf058668dfc","resolution":{"observed_at":"2026-08-07T13:20:18.783558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.242820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.242820Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:524f19d040a64832f0d4c8e9c04e2257bc69987aecbfb2da191fc137268fd439","observation_id":"89b1ac81-2722-4701-964c-bc09b596c553","resolution":{"observed_at":"2026-08-07T13:20:17.242820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.291559Z","title":"conclusion","venue":null,"work_id":"9afa141c-ba97-4b96-9564-a7982cfb2a1d","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.367067Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:aadc4c4d4e99940cf8a41eddb7ee0664d3022f9adb7567439cf836744eae5a2a","observation_id":"92efe1ec-d154-4a5b-bb06-18470675cb3f","resolution":{"observed_at":"2026-08-07T13:20:18.406192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.467252Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.467252Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:064fb5bdbabb45577665a8a8e87040e5532f91a07efb2eebbcb0bd17f9c70d0e","observation_id":"db905805-387f-4bb5-8f29-99dfd5e8faa9","resolution":{"observed_at":"2026-08-07T13:20:17.467252Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.535059Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.535059Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:0cb2bfbffb0ee44ae531e3a64d684b200151f0a12c7f358182d250282a6131fe","observation_id":"12026156-5ed3-45a3-b32f-5f98b0d84f8e","resolution":{"observed_at":"2026-08-07T13:20:17.535059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:17.616522Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.616522Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:2dc2820eac61eff25a1f49c863fedd1895bddbb0a9336c0e718e204e1157bd95","observation_id":"cc4b721e-f123-4f09-ad8f-ed4e19d84568","resolution":{"observed_at":"2026-08-07T13:20:17.616522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:18.037561Z","title":null,"venue":null,"work_id":"e3ebad14-bcc2-42fa-8c1c-8f88003f550c","year":null},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:17.785500Z"},"links":{"citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:dd83bc31eba0da8a7fb04657cef838bc42c9f7302fcd2bff0261ac41cf731975","observation_id":"a50eea92-b63e-4e4f-b570-1d26d36d623f","resolution":{"observed_at":"2026-08-07T13:20:18.118989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13692","last_updated":"2023-07-28T03:31:08Z","snapshot_observed_at":"2026-07-06T15:58:27.523039Z","submitted_at":"2023-07-25T17:55:19Z","title":"ARB: Advanced Reasoning Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13692","snapshot_observed_at":"2026-08-07T13:20:14.608540Z","title":"p\\\" and the cost of a jumbo eraser \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.608540Z"},"links":{"cited_paper":"/paper/2307.13692","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:d9e4bab8f5e3a3fc43f68d48efd599b34afa125f8170a5da9940459a6f853eba","observation_id":"713c670a-8be1-4f03-a533-2e3109cfedac","resolution":{"observed_at":"2026-08-07T13:20:14.608540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T13:20:14.394659Z","title":"arXiv preprint arXiv:2412.21187","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.394659Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:ab41c33d0c8969a46b2341c137e865f01bfb235cc89b165b8bce970b07d3fa46","observation_id":"b00ac0cc-38c1-4948-b687-b6e90501a4a1","resolution":{"observed_at":"2026-08-07T13:20:14.394659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06514","last_updated":"2025-04-11T02:36:28Z","snapshot_observed_at":"2026-08-07T16:07:21.231398Z","submitted_at":"2025-04-09T01:25:27Z","title":"Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06514","snapshot_observed_at":"2026-08-07T13:20:14.455229Z","title":"Kehua Feng, Keyan Ding, Weijie Wang, Xiang Zhuang, Zeyuan Wang, Ming Qin, Yu Zhao, Jianhua Yao, Qiang Zhang, and Huajun Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:14.455229Z"},"links":{"cited_paper":"/paper/2504.06514","citing_paper":"/paper/2505.22113"},"observation_digest":"sha256:b1efbd3dbd6b733819ccbddb61a52beaebb7893efc8563a2c16452b88895b0f8","observation_id":"9edd3401-5a7a-4679-a16e-ab99d28e7a5a","resolution":{"observed_at":"2026-08-07T13:20:14.455229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22113","last_updated":"2025-05-28T08:41:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:12:33.414402Z","submitted_at":"2025-05-28T08:41:14Z","title":"THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":21,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 10 inbound Pith citation observations for arXiv:2505.22113."}