{"as_of":"2026-08-11T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c780d1ef8b1589e4a2d7c2ff80c63f942f71805a0bb12059dc335f8dab755ac6","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:21:45.118956Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04670/citation-record","integrity":"/paper/2608.04670/integrity","json":"/paper/2608.04670/citation-record.json","paper":"/paper/2608.04670"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.844849Z","title":"Lewkowycz, A","venue":null,"work_id":"508527af-0cfb-4eb4-a7e0-58de1407bba9","year":2022},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.956027Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:3c242d254082c0d7a2d84adb17c35ac60613abbfbee8da65da4df10ee43aeb06","observation_id":"fa7468e2-a0f4-4914-bcae-ec7edfd4b7dd","resolution":{"observed_at":"2026-08-06T19:21:45.849252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.831133Z","title":"Chang, X","venue":null,"work_id":"8ace3174-8788-41d5-8bdf-6ccbe811dd99","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.960843Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:5f9b4fa376078cf64a422a8c0d3228ad762eb428226364c26590094e39b40b4d","observation_id":"d1fe282e-2c47-455a-9284-f52d84fc41a1","resolution":{"observed_at":"2026-08-06T19:21:45.835347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.817796Z","title":null,"venue":null,"work_id":"28680e08-c827-4932-8a51-f00436816de5","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.965029Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:2ded0bf88b89f4f00cae45f36634fed6703898b43a0c081bdaeebfd105136086","observation_id":"e731ee4e-e7ee-40ad-a049-d58207ca6228","resolution":{"observed_at":"2026-08-06T19:21:45.822239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-06T19:21:44.969886Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.969886Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:14a1619deba3807b1dab2927d030c078718816ab8a710305aa9b4175fb76fc6a","observation_id":"3d39048b-ef78-4893-b00a-e0898b2c173c","resolution":{"observed_at":"2026-08-06T19:21:44.969886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15521","last_updated":"2025-04-22T01:47:37Z","snapshot_observed_at":"2026-08-10T06:30:04.353250Z","submitted_at":"2025-04-22T01:47:37Z","title":"The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15521","snapshot_observed_at":"2026-08-06T19:21:44.974685Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.974685Z"},"links":{"cited_paper":"/paper/2504.15521","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:aa6cbe8a15c275fde77b5f9f7ab569af39d2203c11626aa95945dd44c907d7f7","observation_id":"f2726dda-cc6f-41a1-acf9-d8277c2e3b49","resolution":{"observed_at":"2026-08-06T19:21:44.974685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-06T19:21:44.979311Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.979311Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:c34a5a39a6d398385c55e466ea1efcc1958f544efbdaa283b6d1d950641f9e57","observation_id":"32961ddf-e62a-4474-9931-7139f5ae7dc2","resolution":{"observed_at":"2026-08-06T19:21:44.979311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.804390Z","title":null,"venue":null,"work_id":"674472f2-96d7-43a8-be10-371cada6fa46","year":2019},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.984335Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:4d4499a8e9ccff6c9a3d7b4bff173fb9d4a849383bdaa627fbde46cc5e1e2853","observation_id":"d1664dfb-7a8b-43ae-9d8f-25dcb1d79db5","resolution":{"observed_at":"2026-08-06T19:21:45.808707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T19:21:44.988297Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.988297Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:f4722274aed0c51ac0b7055968fa1ca3856050231144fb9676fac8c12063cb61","observation_id":"e4a11fcf-645a-4aaa-98c9-6ec210916ee1","resolution":{"observed_at":"2026-08-06T19:21:44.988297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-04T15:54:46.196160Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-06T19:21:44.992611Z","title":"Glazer, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.992611Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:7a2d5120116d3e0b54b855a283cae09b332b3d08bbdd01043a31ae5c77a4c9b6","observation_id":"409df814-db12-4d26-87d8-298b6d9b4a98","resolution":{"observed_at":"2026-08-06T19:21:44.992611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.789445Z","title":null,"venue":null,"work_id":"e609fc95-e909-4482-8ac1-29d03a5ff580","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:44.996759Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:a10dc1fb71ff45cf62fbc8752685e1e22fc24d64fbc3f1c99178867e51a6168f","observation_id":"eb55a51e-25bd-48a6-a8a3-2e1a23e3fbd3","resolution":{"observed_at":"2026-08-06T19:21:45.794336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T19:21:45.000585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.000585Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:9ea714ec5c946f3052b5155aafeb018241bb8de1444a097bdbc4d085f42f2b4f","observation_id":"44e5fd0c-1344-4e75-a719-9bb3ce192717","resolution":{"observed_at":"2026-08-06T19:21:45.000585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-06T19:21:45.005089Z","title":"Chollet, On the measure of intelligence, arXiv preprint arXiv:1911.01547 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.005089Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:b5461c072d202dd34390004dc0f81080d43d8640875cbf364ea83e153751000f","observation_id":"adf15a65-4f2c-4d03-a251-96731052994a","resolution":{"observed_at":"2026-08-06T19:21:45.005089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11831","last_updated":"2026-01-15T23:30:35Z","snapshot_observed_at":"2026-07-06T21:25:27.942187Z","submitted_at":"2025-05-17T04:34:48Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11831","snapshot_observed_at":"2026-08-06T19:21:45.009340Z","title":"Chollet, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.009340Z"},"links":{"cited_paper":"/paper/2505.11831","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:a8a8fcee2cabce04f6f18fca14c257450d6f758041b5b66f9006174d2a1218f5","observation_id":"5841a2f2-84ac-4dcb-b08f-127a485e314a","resolution":{"observed_at":"2026-08-06T19:21:45.009340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.775367Z","title":"Attanasio, P","venue":null,"work_id":"be7fbfca-6b03-4bc2-8123-4326827abc7e","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.013470Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:e75a89b6d035f6eb4140b4a908e8c364bfe8276933f478137b392d0cc9c7ba83","observation_id":"5ca2b51a-5480-4db7-9ac3-05a694cf0493","resolution":{"observed_at":"2026-08-06T19:21:45.779829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-09T12:37:35.222578Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02289","snapshot_observed_at":"2026-08-06T19:21:45.017840Z","title":"Magnini, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.017840Z"},"links":{"cited_paper":"/paper/2502.02289","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:8b6ea24ff8bc5966f48729bf3548c4529185134037d971d69ff837b31dfbabe9","observation_id":"50242c54-3c37-4d0a-8311-5e6ccd0e23b5","resolution":{"observed_at":"2026-08-06T19:21:45.017840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/3-540-45715-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.161372Z","title":null,"venue":null,"work_id":"e30ea032-d92c-484e-bcc6-b9ab69e46bcd","year":2002},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.022090Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:c88dfb80ec2642541bd6e86614dbdc2742c2cd876aed80f0c1f35a11949355ed","observation_id":"3becf2ce-aee1-4e6f-97dd-7a5fdfa9ea04","resolution":{"observed_at":"2026-08-06T19:21:45.166767Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.760760Z","title":"Tedeschi, F","venue":null,"work_id":"f0dc7f71-f335-4266-b54e-7e500055b892","year":2022},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.026171Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:047067a04f800d1834f6011d325cd282653058fae5e7c631a0250a3f5b31eda1","observation_id":"0b1b81e7-71ef-4cc2-8dc1-049d87926a49","resolution":{"observed_at":"2026-08-06T19:21:45.766098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.746341Z","title":"Khoshtab, D","venue":null,"work_id":"f2c7d3ac-2dcc-4f13-90bc-f5387b785487","year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.029963Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:de9d9ee66c5d4d607a2d28a446f4f00dda8824df9280d2c68ecce609e67e7ba9","observation_id":"3fa49c86-3971-4e5c-bc3c-ff461ea6fd2c","resolution":{"observed_at":"2026-08-06T19:21:45.751518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.033785Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.033785Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:40c2a132730363cab6c96a4d2a88a8b4425c666ca3810e92af9930c228092d2d","observation_id":"b2676a61-15f0-4206-a9e0-216573980de9","resolution":{"observed_at":"2026-08-06T19:21:45.033785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.731520Z","title":null,"venue":null,"work_id":"a8136df1-eaa3-418b-b4d4-275a2669f566","year":2023},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.038028Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:8dc719503669279a9ce7ac042a62db9a6bb1b5be29ffaac3366d603ff1df4a72","observation_id":"0aae267c-af0e-4576-99bd-5c6f3ded4d1f","resolution":{"observed_at":"2026-08-06T19:21:45.736703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.716458Z","title":null,"venue":null,"work_id":"02c9d961-45fd-49b5-8663-50a050cabb17","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.041895Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:a78b171ef4c7acdfbd26de7d316bff64dd2cb80664040fee98243a83409a6a71","observation_id":"b6c82470-0b85-460f-bb34-6dd550e20627","resolution":{"observed_at":"2026-08-06T19:21:45.721199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.701607Z","title":"Donthi, M","venue":null,"work_id":"0aa0eb77-2343-4ccb-9fc4-4b5fcc58051e","year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.046086Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:c093cec3df9d21ff97bec6902aff9274227bc3ec7be4964df3d419cb4e1faa68","observation_id":"7dfba636-070c-4208-a330-61e7b51bf8c4","resolution":{"observed_at":"2026-08-06T19:21:45.706277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.685707Z","title":null,"venue":null,"work_id":"085916d6-d03b-4b7b-9b65-098f8aff7f54","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.050259Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:d4de7f858bd36c5c9fc9afaf54d0e67973915b64af891eaf042b153c8a84efdb","observation_id":"d7760f35-722f-4c16-9172-439e74990dff","resolution":{"observed_at":"2026-08-06T19:21:45.691013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11953","last_updated":"2025-01-21T07:54:22Z","snapshot_observed_at":"2026-08-10T17:37:56.371362Z","submitted_at":"2025-01-21T07:54:22Z","title":"Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.11953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11953","snapshot_observed_at":"2026-08-06T19:21:45.382933Z","title":"Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Model","venue":"cs.CL","work_id":"a06054c8-3f64-4026-ad28-ecd733512579","year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.054075Z"},"links":{"cited_paper":"/paper/2501.11953","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:0225051ad0cabc20e0d75384455def676db028030447ab5dff6a86d92f9eb09d","observation_id":"6daa9457-2d54-433c-bd73-1eb68edea5b5","resolution":{"observed_at":"2026-08-06T19:21:45.389273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.670135Z","title":"Caramagna, I 200 proverbi italiani più belli e famosi (con significato), 2025","venue":null,"work_id":"735daeb7-55d2-415d-b016-5f79c0ce0a37","year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.058791Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:65eb7cf5dd31b5d9eeb6f1f3c0d0c345f6de200c1469967321d18587572dd5ac","observation_id":"09ce6256-3f37-4da6-9d04-c4342578370a","resolution":{"observed_at":"2026-08-06T19:21:45.674684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.654161Z","title":"URL: https://openrouter .ai/, accessed: 2025-06-15","venue":null,"work_id":"17629438-cb82-4868-a262-34363c9da5ca","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.062942Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:e7f637713a62cb0f16896bdb3d3971f46f86e787f5750ea77da09c6c18b9a3e6","observation_id":"38eded67-ba3d-48fd-939b-b3ca4da3b4a5","resolution":{"observed_at":"2026-08-06T19:21:45.658978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:21:45.066685Z","title":"Hurst, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.066685Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:1e71998547a1c302fd981cbb7e17b4972d30b7cf859176d12b080f760a225701","observation_id":"e487e10a-0c4b-457c-b815-695b8298c026","resolution":{"observed_at":"2026-08-06T19:21:45.066685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T19:21:45.071212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.071212Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:b7b02c5eae4ec2ea2194b4bb0033c8d0b9032acf54fc7af5dfba1e742d06fbb2","observation_id":"e269fac7-1e18-4536-b981-0c539fa1a946","resolution":{"observed_at":"2026-08-06T19:21:45.071212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T19:21:45.075878Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.075878Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:57471db5866f734dc2a67f179e36e7750aed2541442cbe9946cd4a2a3aa07e7d","observation_id":"5bfe8cad-5a95-4ff0-b287-f69a764c903f","resolution":{"observed_at":"2026-08-06T19:21:45.075878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T19:21:45.080370Z","title":"Team, Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.080370Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:b79c3044a6bfe3322da6bcc453a7e170e2e6f0e8da4ded9f476847e8b3dfb2c3","observation_id":"ecb7b7ea-3c87-443d-beff-9246f08d6f9d","resolution":{"observed_at":"2026-08-06T19:21:45.080370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T19:21:45.084774Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.084774Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:a906bf1b9d4c68d4f45d4b7a9fd83a8ca5e19649f871b6eda593e85358a80bde","observation_id":"5a462dfd-05cb-47d9-9ff0-71c05c9a5435","resolution":{"observed_at":"2026-08-06T19:21:45.084774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.639291Z","title":"Orlando, L","venue":null,"work_id":"214265e4-c6da-44eb-816e-29ad00ff7039","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.089087Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:f4bc0c6fbd606fb686d6dca7707d928b257bcfe053e8e28523fe5fff2c9ce330","observation_id":"af5a729b-cfb3-4a72-876e-fd28f7d1accb","resolution":{"observed_at":"2026-08-06T19:21:45.644039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.624431Z","title":"URL: https://huggingface .co/ mistralai/Mistral-Small-3.1-24B-Instruct-2503","venue":null,"work_id":"ce826508-ff96-4d50-aea7-35a25225ac74","year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.092781Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:4895b54190402dab599e26a3785e8433cd256f84e35eaee7fc660d2c533a4576","observation_id":"60171fa0-2dd6-4f60-9313-81f3b1345f32","resolution":{"observed_at":"2026-08-06T19:21:45.629134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-06T19:21:45.096571Z","title":"Sui, Y.-N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.096571Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:61fe7e63f5b7595b08e1f7e578cdc98e5b91f886d6dd8a02751d67ae7fd42e67","observation_id":"d3a5a1f8-39b5-4461-92ce-32202342d426","resolution":{"observed_at":"2026-08-06T19:21:45.096571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.100736Z","title":"Etxaniz, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.100736Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:e0a75b48840b84479bed29606019d3731d8e99f9ec5f0fb968804562c35fe106","observation_id":"005ae45e-b53a-4848-bbfa-7a72dad54bc4","resolution":{"observed_at":"2026-08-06T19:21:45.100736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.609888Z","title":"Ranaldi, G","venue":null,"work_id":"488e3a2d-753a-4cd5-9ca6-f972bd6f2030","year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.105191Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:a95d4dfd51a2cb145914953fd2bd610271f9aa301defb7a72de48c9fb3c19da2","observation_id":"69c0ce65-5727-4e35-b690-39617bbbd0ea","resolution":{"observed_at":"2026-08-06T19:21:45.614492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:45.109647Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.109647Z"},"links":{"citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:2cec6ecf92b02d2e8b1761cc6521c60be0868cc097162100a92d44830fe57f24","observation_id":"f768a60d-86bc-491b-a4d5-762fe23e970d","resolution":{"observed_at":"2026-08-06T19:21:45.109647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-11T01:19:00.494448Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T19:21:45.114206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.114206Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:788fbc114ebb2c82f1e5085121f204ac0dc8eaa015704943610bfe7cca1059ca","observation_id":"0ebb7780-776f-4606-a588-55645408e891","resolution":{"observed_at":"2026-08-06T19:21:45.114206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14499","last_updated":"2024-07-04T12:51:29Z","snapshot_observed_at":"2026-08-11T15:24:13.325278Z","submitted_at":"2024-02-22T12:47:33Z","title":"\"My Answer is C\": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14499","snapshot_observed_at":"2026-08-06T19:21:45.118956Z","title":"my answer is c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.118956Z"},"links":{"cited_paper":"/paper/2402.14499","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:f74d089586719b4b950b32d663bde897e82109cb683283cbfab70fd7c7db081d","observation_id":"0d10fc8b-a605-42a7-8afb-100a10f1f11c","resolution":{"observed_at":"2026-08-06T19:21:45.118956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.04670."}