{"as_of":"2026-08-10T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b59d26c182adbf642e95647123e56e20ce5f3c99a009d348e5dc470c0bf682e","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:33:13.512658Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:18:28.946759Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:18:29.388938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"cited_work":{"arxiv_id":"2506.10481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10481","snapshot_observed_at":"2026-08-05T21:18:29.388938Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","venue":"cs.AI","work_id":"0feea441-1a9a-4ea0-9fe0-4487a48b73e0","year":2025},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-10T01:28:01.874643Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:28.946759Z"},"links":{"cited_paper":"/paper/2506.10481","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:2a2757a0349a3545d9b8375e2f742733e10a797c5181ca748e6c6c7c4906de43","observation_id":"13979a02-a595-4766-af05-c8b0caeed694","resolution":{"observed_at":"2026-08-05T21:18:29.439278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10481","snapshot_observed_at":"2026-08-04T09:39:47.742161Z","title":"Solvability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17868","last_updated":"2026-07-15T10:42:46Z","snapshot_observed_at":"2026-08-08T11:51:53.258994Z","submitted_at":"2025-10-16T05:07:12Z","title":"UniCode: Augmenting Evaluation for Code Reasoning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:39:47.742161Z"},"links":{"cited_paper":"/paper/2506.10481","citing_paper":"/paper/2510.17868"},"observation_digest":"sha256:9fb064f397ce334441df04c2a41bc51834e2c08c13c248e3b5c4cbd55551a854","observation_id":"dbbbccce-7a7a-4d22-ad08-be68d7ac57e0","resolution":{"observed_at":"2026-08-04T09:39:47.742161Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10481/citation-record","integrity":"/paper/2506.10481/integrity","json":"/paper/2506.10481/citation-record.json","paper":"/paper/2506.10481"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T04:33:07.868175Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:07.868175Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:610095bc424f519428e3d33aaad07e2b6046982377ece3eafc4b771f9dd72a02","observation_id":"677cd943-be5c-4dcf-a8c9-ac7b9834aae1","resolution":{"observed_at":"2026-08-07T04:33:07.868175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T04:33:07.895300Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:07.895300Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:5cfa17fbaf3c0eab258e0c12b4297f19bf9d91d6319a9eb3ff96d5461b09b284","observation_id":"5fb3d385-2c8a-4fb5-9930-86e32248768a","resolution":{"observed_at":"2026-08-07T04:33:07.895300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-07T04:33:07.938420Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:07.938420Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:aa490a1d9a5f8862edece08936364bf57b0465d40756c21125867b198e5d8e78","observation_id":"1eed0699-97f2-441f-8413-d8a27d8de4ee","resolution":{"observed_at":"2026-08-07T04:33:07.938420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-08-08T11:18:18.405211Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-07T04:33:08.113023Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.113023Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:af1d012f2ff96b6f2b7ed9b1073f5a311e00859a7e4f0f9a035b06b63ceba36b","observation_id":"8971f75e-77ab-4780-8d59-2d75b01c8113","resolution":{"observed_at":"2026-08-07T04:33:08.113023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-08-09T23:18:44.909862Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-08-07T04:33:08.236487Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.236487Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:8da65bd634ad3726675c4970e6cf43cee030b825c801b0aba19eb6f637fa8324","observation_id":"7933ce0e-30ce-49d6-a056-1b2d95da9aec","resolution":{"observed_at":"2026-08-07T04:33:08.236487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-07-31T19:08:41.925451Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T04:33:08.345343Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.345343Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:cad49c3d2a2148ab0795f4d4b45687ea480df0cbff1be4256958116aa03262fa","observation_id":"89daff14-5780-49b5-be69-a6f71cfab640","resolution":{"observed_at":"2026-08-07T04:33:08.345343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10952","last_updated":"2024-04-16T23:27:38Z","snapshot_observed_at":"2026-08-07T05:16:48.851507Z","submitted_at":"2024-04-16T23:27:38Z","title":"Can Language Models Solve Olympiad Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10952","snapshot_observed_at":"2026-08-07T04:33:08.494278Z","title":"Can language models solve olympiad programming? CoRR, abs/2404.10952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.494278Z"},"links":{"cited_paper":"/paper/2404.10952","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:4a277f42308a2b49647b2d08f7e25ea89df408bd639da181ad8133ac390eafe9","observation_id":"b523538d-5be5-47d3-99ad-e3c9115faf50","resolution":{"observed_at":"2026-08-07T04:33:08.494278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T04:33:08.592196Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.592196Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0a1b6e179ba69f4894681fef86cc90d685a92bd66592c40cca8d3535d43122eb","observation_id":"e5402a56-4632-4d42-b63f-2a855608d68c","resolution":{"observed_at":"2026-08-07T04:33:08.592196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.352740Z","title":"Effibench: Bench- marking the efficiency of automatically generated code","venue":null,"work_id":"b5fe8a09-298e-4053-99ad-2c4b250f66cb","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.686791Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:cccf91e4c6e9bab78de197f26ce8920972a322af97a46dc9b55e5ac7792b798e","observation_id":"0df138f1-78c1-4e82-8fc4-c382798f3814","resolution":{"observed_at":"2026-08-07T04:33:14.355418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.344236Z","title":"A performance study of llm-generated code on leetcode","venue":null,"work_id":"57d004e2-29ff-442d-9bfe-6975081dfafa","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.803139Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:64c125472ae3d34a91680c365a5f9effc231a1c6d5327e2d525ebcb475e8de3c","observation_id":"17bca638-1c3d-4a3d-9784-a2dc78abc840","resolution":{"observed_at":"2026-08-07T04:33:14.347033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:33:09.009199Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.009199Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:11e1e9f81cbe2bce16b593d125515d008fb5a28075455879e5fcd50248dd67e6","observation_id":"54080233-0ace-4240-9f4a-2f7ce7a3622c","resolution":{"observed_at":"2026-08-07T04:33:09.009199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:09.150957Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.150957Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:85e33843aa3051cfd532fdb4cbe4d6713dc7e5a9e4b07b27fd6930cc07046509","observation_id":"642496ed-ad65-45d1-b167-ee0c48c136be","resolution":{"observed_at":"2026-08-07T04:33:09.150957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.331664Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":"1b191fe7-20b2-452a-b28c-8522155d52ce","year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.261275Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:7ae3c5764664c1e3f2244e5d75acb35067abbe07a5a8375413c5470ecfa285c3","observation_id":"3901de89-a2fe-44eb-8d03-327450d93252","resolution":{"observed_at":"2026-08-07T04:33:14.334289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T04:33:09.361597Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.361597Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:37796424670858e576d788c6a347fa4cce089b1ca027a91e0c2fb4a5e04a1cdc","observation_id":"b1450cc4-1139-4609-83d5-ce03f3fd2944","resolution":{"observed_at":"2026-08-07T04:33:09.361597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:33:09.512190Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.512190Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:4be1f9ef79e09074184452ff9b643988d594a690075078b4493b3ec7bfc817bd","observation_id":"44bfdff2-8214-40e2-9022-85520e23a5fa","resolution":{"observed_at":"2026-08-07T04:33:09.512190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:09.609005Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.609005Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:453daa1456f4a4fbadb14bce3050e10ba6ea32e0a53d37e9835d89e9b4af3440","observation_id":"6b3a8478-b429-413d-927c-2b2ce0f6eba6","resolution":{"observed_at":"2026-08-07T04:33:09.609005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.319558Z","title":"Cohen, Ruslan Salakhut- dinov, and Christopher D","venue":null,"work_id":"32afe33c-3ad6-480d-bb9f-e51aea78e75f","year":2018},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.793808Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:a1c6f5575acfd9c27df2a84047669a07c31a68820654701185f9beeacf81ad25","observation_id":"f94983e6-4a73-4d5e-ab04-21ddc0139989","resolution":{"observed_at":"2026-08-07T04:33:14.322073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.311656Z","title":"Logicbench: Towards systematic evaluation of logical reasoning ability of large language models","venue":null,"work_id":"819d56c9-0585-4754-9358-56ea3a1c38d7","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:09.948383Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:07f66e3d62300e0890713d77c41bd53092f790cbdb75a8183243ade4adfc2228","observation_id":"5ed49304-8946-4d3d-97d9-ba86e3bd6312","resolution":{"observed_at":"2026-08-07T04:33:14.314247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.303920Z","title":"Criticbench: Benchmarking llms for critique-correct reasoning","venue":null,"work_id":"81371d03-a7aa-4c06-93a0-550c030bbb88","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.071881Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:30f86b941a9e415dc22e9139fa4fae2bedfb4496ae949d9f165643c096ca1701","observation_id":"fb1688cf-6872-4115-987d-2288f1ad5ade","resolution":{"observed_at":"2026-08-07T04:33:14.306856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12521","last_updated":"2025-02-18T04:11:29Z","snapshot_observed_at":"2026-08-07T18:10:14.927590Z","submitted_at":"2025-02-18T04:11:29Z","title":"Inference-Time Computations for LLM Reasoning and Planning: A Benchmark and Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12521","snapshot_observed_at":"2026-08-07T04:33:10.196140Z","title":"Inference-time computations for LLM reasoning and planning: A benchmark and insights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.196140Z"},"links":{"cited_paper":"/paper/2502.12521","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e23dae36f15594ef3b4c8b580392af3209a402388db94eb3d8a847c6c47f37cc","observation_id":"e6186f45-f387-4eaa-8c0c-0ba4ae4d219d","resolution":{"observed_at":"2026-08-07T04:33:10.196140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-07T04:33:10.271856Z","title":"Logicvista: Multimodal LLM logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.271856Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:f7dc5a9ab36f0057066478507c99504ade2c966c40a865eb393d1b929c6a47bb","observation_id":"0b740906-92a7-4fd4-96b5-eacbd9f605c5","resolution":{"observed_at":"2026-08-07T04:33:10.271856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-09T15:29:45.493907Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T04:33:10.361435Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.361435Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:cf9403bfc78b49a0de6a45216bf6e70972448ae0a95114833f99fe1afc14c64f","observation_id":"257705c7-de3a-4bd4-beb8-34177dabd9b4","resolution":{"observed_at":"2026-08-07T04:33:10.361435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-07T04:33:10.456529Z","title":"Logicgame: Benchmarking rule-based reasoning abilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.456529Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:a259bdfaa664141bd04cc1046e54caecb14365da0dd1137698c385005b9da4ed","observation_id":"76549ae5-f538-4580-a655-95ee05d74ed8","resolution":{"observed_at":"2026-08-07T04:33:10.456529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.295791Z","title":"Are llms capable of data-based statistical and causal reasoning? benchmarking advanced quantitative reasoning with data","venue":null,"work_id":"303c58ed-680b-46f1-bd69-9049dd20ba00","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.553871Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:bcd295d7de9b218c4931649207f07e0e19b4e30e94953d013c1fe90750903b1d","observation_id":"d3e75ec1-cd0f-449f-b2f6-6dc02a3ad2d9","resolution":{"observed_at":"2026-08-07T04:33:14.299145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.288260Z","title":"Codereval: A benchmark of pragmatic code generation with generative pre-trained models","venue":null,"work_id":"b08f95e5-6581-4a86-aa35-8604e7b07da0","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.636451Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e4bd7be07f04deea6a761f507b531aa6e11da061426183b52787fc87cce32fc7","observation_id":"d92827bc-67a8-4fd7-b70b-55ec6e095b75","resolution":{"observed_at":"2026-08-07T04:33:14.291143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11470","last_updated":"2024-10-09T05:59:07Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T08:08:48Z","title":"Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11470","snapshot_observed_at":"2026-08-07T04:33:10.690842Z","title":"Beyond correctness: Benchmarking multi-dimensional code generation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.690842Z"},"links":{"cited_paper":"/paper/2407.11470","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:b29c66890ef310738b532354ad980152fc826dfc15423497cd503eff8d07af67","observation_id":"936321a4-c108-462a-bd8c-590b38ec447c","resolution":{"observed_at":"2026-08-07T04:33:10.690842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09043","last_updated":"2024-09-05T14:00:11Z","snapshot_observed_at":"2026-07-06T14:43:31.440090Z","submitted_at":"2023-01-22T02:59:59Z","title":"CodeScore: Evaluating Code Generation by Learning Code Execution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09043","snapshot_observed_at":"2026-08-07T04:33:10.781213Z","title":"Codescore: Evaluating code generation by learning code execution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.781213Z"},"links":{"cited_paper":"/paper/2301.09043","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:960e9c0978bf014964482a2c813a08340c684c05b64feac734a2276790f3f2a0","observation_id":"0655c6db-019a-414a-90cd-857c259b7560","resolution":{"observed_at":"2026-08-07T04:33:10.781213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.281165Z","title":"Cruxeval: A benchmark for code reasoning, understanding and execution","venue":null,"work_id":"1888f9e9-6748-4377-9c87-dacd8fba66b6","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.889582Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:83c6c30f28bc7b925a61f52998ba3008ac45b5d8666b329a278372638ef4d5e2","observation_id":"899dd107-2403-4bd5-81cc-ccb94887e1b4","resolution":{"observed_at":"2026-08-07T04:33:14.283713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:10.980550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.980550Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:4b6b966563d2c80f98f3e83aa29cdc63cb7cc0d004c6ee694f35ec15eaa31ac5","observation_id":"e2cd57c7-dded-4765-bbc7-79afff3440b4","resolution":{"observed_at":"2026-08-07T04:33:10.980550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19149","last_updated":"2025-02-26T14:08:17Z","snapshot_observed_at":"2026-08-07T17:46:15.418149Z","submitted_at":"2025-02-26T14:08:17Z","title":"Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19149","snapshot_observed_at":"2026-08-07T04:33:11.064635Z","title":"Isolat- ing language-coding from problem-solving: Benchmarking llms with pseudoeval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.064635Z"},"links":{"cited_paper":"/paper/2502.19149","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:6b1422baf387e36c725670c93688f816e33f041a574f990e70ed7da1a320925b","observation_id":"cf56bd4a-4897-40bf-b472-3e3af2586d02","resolution":{"observed_at":"2026-08-07T04:33:11.064635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06643","last_updated":"2026-07-06T05:56:24Z","snapshot_observed_at":"2026-08-07T17:18:54.590513Z","submitted_at":"2025-03-09T14:41:18Z","title":"Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06643","snapshot_observed_at":"2026-08-07T04:33:11.149875Z","title":"Is your benchmark (still) useful? dynamic benchmarking for code language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.149875Z"},"links":{"cited_paper":"/paper/2503.06643","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:1aeb7046cd797c87397962fae98e0595b0c293c8e549cc8ad40f0bb65326e457","observation_id":"d710289c-aca7-4203-b897-827a8eb75b65","resolution":{"observed_at":"2026-08-07T04:33:11.149875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04149","last_updated":"2025-06-03T22:14:34Z","snapshot_observed_at":"2026-08-07T17:25:44.092200Z","submitted_at":"2025-03-06T06:56:59Z","title":"Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04149","snapshot_observed_at":"2026-08-07T04:33:11.223662Z","title":"Dynamic benchmarking of reasoning ca- pabilities in code large language models under data contamination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.223662Z"},"links":{"cited_paper":"/paper/2503.04149","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:50edb1e812f333f48f64a510ebef80f8dc747203dde9673dba09de00e875c4bc","observation_id":"81670f9e-1a1b-4357-9c81-a8e809fea339","resolution":{"observed_at":"2026-08-07T04:33:11.223662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04197","last_updated":"2024-09-22T12:40:35Z","snapshot_observed_at":"2026-07-06T18:26:37.581248Z","submitted_at":"2024-06-06T15:55:53Z","title":"DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04197","snapshot_observed_at":"2026-08-07T04:33:11.291003Z","title":"DICE: detecting in- distribution contamination in llm’s fine-tuning phase for math reasoning.CoRR, abs/2406.04197, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.291003Z"},"links":{"cited_paper":"/paper/2406.04197","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:25010674fbfb7b050a8187bd436d8231913c1feba89ac2f399177bddc76a47f0","observation_id":"7cbaf7ec-3ed3-4e85-ac20-d6eec217d703","resolution":{"observed_at":"2026-08-07T04:33:11.291003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19341","last_updated":"2023-10-30T08:31:47Z","snapshot_observed_at":"2026-08-06T06:09:43.812715Z","submitted_at":"2023-10-30T08:31:47Z","title":"Skywork: A More Open Bilingual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19341","snapshot_observed_at":"2026-08-07T04:33:11.374239Z","title":"Skywork: A more open bilingual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.374239Z"},"links":{"cited_paper":"/paper/2310.19341","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0de2e99e1f66aa9f58479e377f8957f75280ace5046bf802025f3158d8fed905","observation_id":"86c6e912-7fc3-4588-a43e-04df53aa5026","resolution":{"observed_at":"2026-08-07T04:33:11.374239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-09T17:21:02.287748Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T04:33:11.477391Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.477391Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:064fcd77b49a197c646e80e20e3a37aa6f99df59e17b0dd2dbfbb47e6ce91448","observation_id":"9a361e93-bc4a-4fe3-8ff8-29e3ba0a6029","resolution":{"observed_at":"2026-08-07T04:33:11.477391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.273775Z","title":"Investigating data contamination in modern benchmarks for large language models","venue":null,"work_id":"13259565-8de4-4015-9d2c-717d965198b2","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.551800Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e318cf1ada0535c96d31ecc77db4d6c022817cd2715092ddda0fb5555321af8d","observation_id":"21f92f1a-3f2d-4dfb-aa4f-5b0138120960","resolution":{"observed_at":"2026-08-07T04:33:14.276180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-07T04:33:11.622079Z","title":"Tahar Kechadi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.622079Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:420cd95888f6c62bfb682addb3ff5d387ffb9568d536d8e0b85ded1a41ab186c","observation_id":"e1523533-2660-400b-a1a6-ae70109142aa","resolution":{"observed_at":"2026-08-07T04:33:11.622079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.266211Z","title":"Docker: lightweight linux containers for consistent development and deployment","venue":null,"work_id":"09070e44-a561-4e30-a9d7-278e9fb7c5c2","year":2014},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.694824Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:d08564e216271206dc8f6a7fd1d62e0c6915a6c95daeb4ad4da32de94aa5d071","observation_id":"581e0455-150e-48ab-9d57-5697dd66c467","resolution":{"observed_at":"2026-08-07T04:33:14.269060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:33:11.777217Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.777217Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:368ae1d20af5ab7a778f1c87f39fe60b3e29fd85872bc7455191a0582f2ad263","observation_id":"84463afe-3213-45f6-a19b-96af79e2c121","resolution":{"observed_at":"2026-08-07T04:33:11.777217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-07T10:39:44.274910Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-07T04:33:11.879063Z","title":"Adding error bars to evals: A statistical approach to language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.879063Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:ba0b4e62417f774ccd196f5f473749277f3944465caac3c600c6bbaf75bf9ce2","observation_id":"5c822408-c600-4247-902c-ca8fd4e6e333","resolution":{"observed_at":"2026-08-07T04:33:11.879063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.258634Z","title":"Nolazco-Flores, Lori Landay, Matthew Thomas Jackson, Paul Röttger, Philip H","venue":null,"work_id":"aef1f770-7fce-492c-94c9-07c103d7415e","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.977474Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:1f6409fcd7a3a5c1bd3967b889746074a3b51ae7b83abe14a00e774fd7aa0dd5","observation_id":"10f87df3-ad7f-464e-b7ed-19503c52def0","resolution":{"observed_at":"2026-08-07T04:33:14.261358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:33:12.079334Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.079334Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:e80d901a6c14cda9e89768a7d815e533f422ae5f8a30761dacf4600c322acc33","observation_id":"78bc563c-3cb6-405f-8318-ba1d6dad94cc","resolution":{"observed_at":"2026-08-07T04:33:12.079334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T04:33:12.172149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.172149Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:9006d32da13b806f6c5f6dd5ab20f6ed868127cf24b50d5219b89dfce3cd5830","observation_id":"fe56bd4e-ee86-4a6d-b0d5-d7659287e70a","resolution":{"observed_at":"2026-08-07T04:33:12.172149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:33:12.250698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.250698Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:2c05a399210d529b9256c9ed32fa0337e139f5a5970f0fa1da23bad0e30278a9","observation_id":"0f70dad5-8764-4312-90b2-39fd99cf8493","resolution":{"observed_at":"2026-08-07T04:33:12.250698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:33:12.323405Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.323405Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:64ef959abcffca5e40c72763c9a2bfa4d35aae50f6f34a8b0c66416e08287a9a","observation_id":"0529cc92-095b-44cb-8316-c9290a998c21","resolution":{"observed_at":"2026-08-07T04:33:12.323405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.250805Z","title":"doubao-pro-32k","venue":null,"work_id":"0ce30160-c5a7-475f-8bd7-0ee5e69571c4","year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.399148Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:3b634ca3d9ff72715109dba44a7b771aa6b72e24ee26f0e65cb0ffedb285f5aa","observation_id":"3aeae70a-eee1-41d7-9a3a-e4ddcdf67436","resolution":{"observed_at":"2026-08-07T04:33:14.253388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:33:12.478817Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.478817Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:b764a28d533ba0d61de98d0fefb805ec6cecd7c2dfd07131e334b0d3b936ebb5","observation_id":"cc5cf503-ffa5-4de0-bbac-16aa997f02ab","resolution":{"observed_at":"2026-08-07T04:33:12.478817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.235696Z","title":"claude 3.5 sonnet","venue":null,"work_id":"5f808b1d-f64f-4da6-9349-028b6c75f0c8","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.507631Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:2b9608cee57f38b439b7a276f2e14ae8e8647b999e20e34ce6da0d548ecdff22","observation_id":"f8db0d76-cfd0-479b-b6cf-7caf3d627a57","resolution":{"observed_at":"2026-08-07T04:33:14.238282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.227786Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"f9a3b367-5b83-4578-9e93-dad128ed257b","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.617668Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:4073e7dd7e0285784b8af916ef511bc5ad2e82b76aed95b7faa7faa17d126bac","observation_id":"403f9abe-e5ea-4cf3-bc42-4d22cfb671a1","resolution":{"observed_at":"2026-08-07T04:33:14.230706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.219805Z","title":null,"venue":null,"work_id":"a3b59af9-2e83-4d9c-a19f-217d9474e912","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.706993Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:ab4ed479bcaa594236c547a271de288eb4e7ea58e715aaab691412168a5c5dc7","observation_id":"285ab06e-1f0e-4e19-b97e-d93f3d7f8337","resolution":{"observed_at":"2026-08-07T04:33:14.222489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.211759Z","title":null,"venue":null,"work_id":"551929d3-43ae-4fa5-8abf-b0dd1b90cc2c","year":null},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.833113Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:5bb59b056b37d9f612aea1f14c1edf9dc97e638e40d2864409d60684fd0f6802","observation_id":"9c620678-4793-4185-978f-c60b35414ddc","resolution":{"observed_at":"2026-08-07T04:33:14.214256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T04:33:13.126641Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.126641Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:07382f77a40a0403835a687df95bfdbbb19f3b73ddb942eadd0e01a576d98adf","observation_id":"deed81ee-5c08-42de-9023-ce48a68ffa60","resolution":{"observed_at":"2026-08-07T04:33:13.126641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.204103Z","title":null,"venue":null,"work_id":"dc25d3fc-776e-4b1a-bb59-9b0ad962b81e","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.976100Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:3ef6ee41509fbabd47d4dde1879a89cbde0351ce7e1a4388125bff7c83ae1b48","observation_id":"60544d7f-15a2-489a-8b3c-118c1fc619ac","resolution":{"observed_at":"2026-08-07T04:33:14.206611Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14503","last_updated":"2025-05-23T05:26:50Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T08:31:06Z","title":"Planning-Driven Programming: A Large Language Model Programming Workflow","version":3},"cited_work":{"arxiv_id":"2411.14503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14503","snapshot_observed_at":"2026-08-07T04:33:13.600619Z","title":"Planning-Driven Programming: A Large Language Model Programming Workflow","venue":"cs.SE","work_id":"5fec93f8-5036-4297-8a69-ea91d283150f","year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.290319Z"},"links":{"cited_paper":"/paper/2411.14503","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:090367a3f1777085d8f5e2f7e846ae189c78efed6b787b8a9a6515dbd3875b59","observation_id":"19fc4506-4f00-48ae-b270-3aa91ee352fc","resolution":{"observed_at":"2026-08-07T04:33:13.651606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T04:33:13.242807Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.242807Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:f602d6361da3f93977dd848ac640814257bbc76b89021ef7a1223222edcdd76e","observation_id":"715587bd-377a-4a17-973e-dbeb65973865","resolution":{"observed_at":"2026-08-07T04:33:13.242807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02310","last_updated":"2025-02-24T09:25:51Z","snapshot_observed_at":"2026-08-04T04:41:35.684065Z","submitted_at":"2024-11-04T17:36:40Z","title":"MdEval: Massively Multilingual Code Debugging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02310","snapshot_observed_at":"2026-08-07T04:33:13.471509Z","title":"Mdeval: Massively multilingual code debugging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.471509Z"},"links":{"cited_paper":"/paper/2411.02310","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:b73344a03012fdca447a90a99117049991810ab33b835320ad93156c09841dce","observation_id":"27f0621f-2e87-4b49-b354-a7e7f545caa3","resolution":{"observed_at":"2026-08-07T04:33:13.471509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T04:33:13.374423Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.374423Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:90a28f0d87f6cd3da977e58b1a7ecd57d16bed1605001ac83e7869fae70e98df","observation_id":"fbc1b3c7-92aa-45d0-916b-6e48fd573c5a","resolution":{"observed_at":"2026-08-07T04:33:13.374423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.188194Z","title":"Codetransocean: A comprehensive multilingual benchmark for code translation","venue":null,"work_id":"211de308-0d2c-474a-960e-2684a9156c32","year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.509440Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:df4326b888846689872faafa7d64e6e409e89041f88db4581a8d1937ddb81445","observation_id":"4113a733-6537-474f-8a8e-bc155c22e733","resolution":{"observed_at":"2026-08-07T04:33:14.191077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.196458Z","title":null,"venue":null,"work_id":"2da51440-6326-4643-862c-f6a3837e43a0","year":2021},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.480183Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:29e574ea615756d674ab90cc0c63a5a187b5f2e303fab5cd5e3298d2b4290794","observation_id":"946b8748-aacf-4824-b769-b34ddf9071d9","resolution":{"observed_at":"2026-08-07T04:33:14.199024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.102311Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"86885235-3924-43af-aa20-fce077340ae4","year":2023},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:13.512658Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:710da166baa2243e7a1897f3d1d0963753e7cf73d30338b3d6aca01416f82e40","observation_id":"fc7e4390-da56-4d66-955b-7a41fb5b3a58","resolution":{"observed_at":"2026-08-07T04:33:14.174519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:14.243123Z","title":null,"venue":null,"work_id":"800e5e1b-5b00-42a3-adeb-64d6bebb3ade","year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:12.468028Z"},"links":{"citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:c8033b2b346569074d692c98b0b96ebf31760a145d2f6e1f521090d276f826f2","observation_id":"9991e6ca-2d3c-4e5b-b22d-0a670a1e87ba","resolution":{"observed_at":"2026-08-07T04:33:14.245758Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":41,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2506.10481."}