{"as_of":"2026-08-14T15:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6b5ac150fb90982cb2c855ccd9c8f65fcd9b6ce6add0f62b070a3d0b9bdc212","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:25:31.762978Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:58:02.335060Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T12:58:02.541932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2412.08972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08972","snapshot_observed_at":"2026-08-11T12:58:02.541932Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","venue":"cs.CL","work_id":"27aa050f-b48f-4114-90a9-cb9e8b628bab","year":2024},"citing_paper":{"arxiv_id":"2412.13670","last_updated":"2025-05-29T03:19:42Z","snapshot_observed_at":"2026-08-12T14:04:58.110354Z","submitted_at":"2024-12-18T09:53:12Z","title":"AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T12:58:02.335060Z"},"links":{"cited_paper":"/paper/2412.08972","citing_paper":"/paper/2412.13670"},"observation_digest":"sha256:04b6c6e1f7dcd0182a0f6f3238fd67eccd93ecae5f1c43720ae81117165bdcf6","observation_id":"dd2a529d-24b1-45f7-8885-b74ad43c7ffc","resolution":{"observed_at":"2026-08-11T12:58:02.549983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08972/citation-record","integrity":"/paper/2412.08972/integrity","json":"/paper/2412.08972/citation-record.json","paper":"/paper/2412.08972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:31.466590Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.466590Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c99ad9817cd6514bf185a14492c6568448a9af9d0e014c8c708942aec4eba766","observation_id":"fe74d52f-9e9a-4981-9381-23d17cb9ce5a","resolution":{"observed_at":"2026-08-11T17:25:31.466590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:31.472716Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.472716Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:a3cd86f92727f398c9f2ae17ae04a71dc59109e1193b3490936fb41fd76f6d8f","observation_id":"c9c95e2b-5f9e-46d6-bf7c-2a2d276398b7","resolution":{"observed_at":"2026-08-11T17:25:31.472716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-10T18:39:13.771066Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-11T17:25:31.478406Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.478406Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:0d34d3e7fc2389340896ec1bf31478f05724072f881f9eb505ee34f740e9ea24","observation_id":"599ee7b7-00f5-4437-a3b6-b38fe3bb4ac1","resolution":{"observed_at":"2026-08-11T17:25:31.478406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.629491Z","title":null,"venue":null,"work_id":"c75dc7b6-1502-4399-b880-d6d824d96503","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.484261Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:83988095b9f0c99e1198be93aa2f2b5ce52204a1308ed592c33de478e9386dbc","observation_id":"472af47e-a485-4b67-bd82-325ffc628e56","resolution":{"observed_at":"2026-08-11T17:25:32.634419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-11T17:25:31.490688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.490688Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:a2eb9dda9c8ed349096611658755a120a0245849fe181a81a6947f93c6280d0c","observation_id":"8c645659-9cea-455c-896a-efcc98ce5329","resolution":{"observed_at":"2026-08-11T17:25:31.490688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00690","last_updated":"2024-01-01T07:35:31Z","snapshot_observed_at":"2026-08-13T04:50:33.970808Z","submitted_at":"2024-01-01T07:35:31Z","title":"Benchmarking Large Language Models on Controllable Generation under Diversified Instructions","version":1},"cited_work":{"arxiv_id":"2401.00690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00690","snapshot_observed_at":"2026-08-11T17:25:32.514344Z","title":"Benchmarking Large Language Models on Controllable Generation under Diversified Instructions","venue":"cs.CL","work_id":"9642555d-2c04-47f0-9322-a207b64ddce2","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.502542Z"},"links":{"cited_paper":"/paper/2401.00690","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:44cf29e2647bfe53919314fd9a0ecc98a493cbae907d56af1b45144c9c87c90f","observation_id":"c9fcdded-cafc-41bd-aeb4-2870f989629b","resolution":{"observed_at":"2026-08-11T17:25:32.521547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T17:25:31.507934Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.507934Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:e5ecfefa386db6dfc0488ef68a0296a3537e8f8d94a6dd2d9a566eef7ff8fd9d","observation_id":"b3ab5312-a0a8-4a93-8215-efe0af9a4d2f","resolution":{"observed_at":"2026-08-11T17:25:31.507934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-11T17:25:31.514193Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.514193Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:9321797cceaeffcdf6d0d4c1f7ad5c0b227ce73b7d21825d3f531f3631379f7f","observation_id":"75cfa14a-b8f9-4487-896f-7ae1df5c893d","resolution":{"observed_at":"2026-08-11T17:25:31.514193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T17:25:31.522554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.522554Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:48044b46d4072c1132dd648d4103d9d7f8641eaa34fd9d4f27f734846d3e4324","observation_id":"ab56d529-30ee-4481-861e-93a4c9952e9d","resolution":{"observed_at":"2026-08-11T17:25:31.522554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14890","last_updated":"2024-02-12T17:30:25Z","snapshot_observed_at":"2026-08-13T04:55:05.104749Z","submitted_at":"2023-12-22T18:07:44Z","title":"NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14890","snapshot_observed_at":"2026-08-11T17:25:31.528740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.528740Z"},"links":{"cited_paper":"/paper/2312.14890","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:340745fdf90420bc32441624195370a0da277b0ff7ae5e274b23bba99e01f52d","observation_id":"cef593c2-1dbc-4197-adc3-f9923440cff7","resolution":{"observed_at":"2026-08-11T17:25:31.528740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-08-13T12:55:24.563089Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-08-11T17:25:31.534205Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.534205Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:033fd642d7c525427d6b69e3dbe0bda79cb534ec5f2b03b062372e724a14967f","observation_id":"dcd5b8b4-e197-468e-b98f-c474912133a6","resolution":{"observed_at":"2026-08-11T17:25:31.534205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04971","last_updated":"2020-02-15T19:26:05Z","snapshot_observed_at":"2026-08-13T02:35:29.699330Z","submitted_at":"2019-12-10T20:36:07Z","title":"Neural Module Networks for Reasoning over Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04971","snapshot_observed_at":"2026-08-11T17:25:31.539635Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.539635Z"},"links":{"cited_paper":"/paper/1912.04971","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:806a1a9b5bf63358665eedac96cc64ce8a8d9841d2e0359742b68e91b8c0c815","observation_id":"faa6572b-b8ad-4e9f-8cc2-f61ace86641f","resolution":{"observed_at":"2026-08-11T17:25:31.539635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-08-13T14:34:10.626792Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-11T17:25:31.545315Z","title":"Joty, Alexander R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.545315Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:1bc29529246d9b6f98c3799bfa0d63320231bb6cd7ac370ea79edd2afe876c22","observation_id":"80815c01-31e8-47f4-862e-111eaa9ec44e","resolution":{"observed_at":"2026-08-11T17:25:31.545315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09150","last_updated":"2024-01-08T07:49:23Z","snapshot_observed_at":"2026-08-13T10:12:10.290081Z","submitted_at":"2023-09-17T04:18:39Z","title":"Can Large Language Models Understand Real-World Complex Instructions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09150","snapshot_observed_at":"2026-08-11T17:25:31.551256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.551256Z"},"links":{"cited_paper":"/paper/2309.09150","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:58e1a764f413b14f20e830f60c48b77a2e321a38b69ce0dd2f9b651fd5c5b236","observation_id":"a36dd340-b6a0-4515-8470-c043cb3bfde8","resolution":{"observed_at":"2026-08-11T17:25:31.551256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T17:25:31.556838Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.556838Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:105d1f3ef5798f171dac22491b0fb529d1ef00057ecf355790148273732abc7d","observation_id":"3b3b2d29-82b6-4140-8d85-e1d892dbcc71","resolution":{"observed_at":"2026-08-11T17:25:31.556838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02787","last_updated":"2024-06-04T21:25:06Z","snapshot_observed_at":"2026-08-12T23:50:06.797793Z","submitted_at":"2024-06-04T21:25:06Z","title":"Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02787","snapshot_observed_at":"2026-08-11T17:25:31.562964Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.562964Z"},"links":{"cited_paper":"/paper/2406.02787","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:9596f424bfeb29e3f1b4d2aaa0a79d2be9d4f6b95f7d05b6640c24d5a733a2e7","observation_id":"dad0c5e5-51b0-4dea-a78e-47e6e0f51821","resolution":{"observed_at":"2026-08-11T17:25:31.562964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02981","last_updated":"2024-01-24T18:16:34Z","snapshot_observed_at":"2026-08-13T04:50:35.316687Z","submitted_at":"2024-01-01T06:22:04Z","title":"Fine-tuning and Utilization Methods of Domain-specific LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02981","snapshot_observed_at":"2026-08-11T17:25:31.568737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.568737Z"},"links":{"cited_paper":"/paper/2401.02981","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:874a0def6c5f52045128d1313a0d642d3b141953ced236531c64e77931eac4e5","observation_id":"1bcfb457-4e42-403d-b33e-24e07603a894","resolution":{"observed_at":"2026-08-11T17:25:31.568737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20410","last_updated":"2024-06-05T15:39:26Z","snapshot_observed_at":"2026-08-14T04:42:20.902549Z","submitted_at":"2023-10-31T12:32:38Z","title":"FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20410","snapshot_observed_at":"2026-08-11T17:25:31.573876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.573876Z"},"links":{"cited_paper":"/paper/2310.20410","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:96340bb31fb0298596a42f3ef13c5ef14a2fc9e3bd7a68f777eae5c5ee990298","observation_id":"84047906-9d58-4a8b-b19f-970db3f7ca96","resolution":{"observed_at":"2026-08-11T17:25:31.573876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-13T05:54:24.242465Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-11T17:25:31.579584Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.579584Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:abc5d3dee084ace3c6456fa776f324ce1fa3a0056a4ca5ba2a794bd73cc1d730","observation_id":"554c006a-5a8d-431e-90e0-d7d6e714a2b1","resolution":{"observed_at":"2026-08-11T17:25:31.579584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.613474Z","title":null,"venue":null,"work_id":"2287c2bd-e93f-49c3-870f-9ee062aa4934","year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.590606Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:a92124f7a58d96861a51acd0f9ab5029c2118601da54ca6e6377d98681b7a098","observation_id":"8c110deb-f1f6-4d3d-b68f-216350ef4e65","resolution":{"observed_at":"2026-08-11T17:25:32.618511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-13T10:15:11.378091Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-11T17:25:31.596604Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.596604Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:ccf52efa9eab03c8aa56f987cad42c69cd38ea4cfed63c396b3a1a92af3b28a1","observation_id":"e8113bb3-d5cd-4f4a-aaa8-2ac2ecb38777","resolution":{"observed_at":"2026-08-11T17:25:31.596604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18743","last_updated":"2024-08-25T09:58:57Z","snapshot_observed_at":"2026-08-13T05:13:04.857556Z","submitted_at":"2023-11-30T17:41:30Z","title":"AlignBench: Benchmarking Chinese Alignment of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18743","snapshot_observed_at":"2026-08-11T17:25:31.603431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.603431Z"},"links":{"cited_paper":"/paper/2311.18743","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:07b064b48b067244476cdb316bb80027f580d74e6ec76afbc857c663781711f3","observation_id":"66f26733-5eae-44f1-b1d6-7627e89aeeab","resolution":{"observed_at":"2026-08-11T17:25:31.603431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12584","last_updated":"2019-04-26T06:50:54Z","snapshot_observed_at":"2026-08-14T15:11:29.078895Z","submitted_at":"2019-04-26T06:50:54Z","title":"The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12584","snapshot_observed_at":"2026-08-11T17:25:31.609161Z","title":"Tenenbaum, and Jiajun Wu","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.609161Z"},"links":{"cited_paper":"/paper/1904.12584","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:a221b1157cc941e6cd0237eb592364d59db607d33c02f09fabe9addb02679119","observation_id":"d3cafca9-863a-4946-9151-f0ca0cfdaa72","resolution":{"observed_at":"2026-08-11T17:25:31.609161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T17:25:31.620525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.620525Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c6cef52c67fb202a620bd2473d5a3b75b1f7a0fb0c588c64ef426b1c92d722b3","observation_id":"8e8f1c96-c593-444a-ba49-79d753438df8","resolution":{"observed_at":"2026-08-11T17:25:31.620525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.596625Z","title":null,"venue":null,"work_id":"b7b343fe-4f7c-4736-ba82-a07fe1fc2d82","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.626065Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:163d3eea685a4c5ec44dc6684233ca52bb672adfba5a48f2a82fc47b3fecd040","observation_id":"a7fe685c-4e24-41a8-9943-9522fe5cded6","resolution":{"observed_at":"2026-08-11T17:25:32.601585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04235","last_updated":"2024-03-08T17:04:49Z","snapshot_observed_at":"2026-08-13T05:32:20.254825Z","submitted_at":"2023-11-06T08:50:29Z","title":"Can LLMs Follow Simple Rules?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04235","snapshot_observed_at":"2026-08-11T17:25:31.631000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.631000Z"},"links":{"cited_paper":"/paper/2311.04235","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:1f5f3be2763c2c6df9d2486a8c5845e28db21693ff016360a70833a3403a97e3","observation_id":"a2997379-5792-4bc2-ba04-86a4b9da5cdb","resolution":{"observed_at":"2026-08-11T17:25:31.631000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12295","last_updated":"2023-10-19T01:54:27Z","snapshot_observed_at":"2026-08-13T11:38:06.596569Z","submitted_at":"2023-05-20T22:25:38Z","title":"Logic-LM: Empowering Large Language Models with Symbolic Solvers for Faithful Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12295","snapshot_observed_at":"2026-08-11T17:25:31.635627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.635627Z"},"links":{"cited_paper":"/paper/2305.12295","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:4399dbb75844fec4ae1c091d49390a18c4408da997784169ddaee46fccacc4b9","observation_id":"d07f299e-107c-41cc-a9d8-1f3fb7fbe234","resolution":{"observed_at":"2026-08-11T17:25:31.635627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:31.640961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.640961Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:b861584cc24a91a5244bac6ca56b7f26282123d6655002526aecce6b8058a8f6","observation_id":"54d7ec07-72ff-4892-8fef-63be4a50f400","resolution":{"observed_at":"2026-08-11T17:25:31.640961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14542","last_updated":"2023-10-23T03:48:24Z","snapshot_observed_at":"2026-08-13T05:43:31.834888Z","submitted_at":"2023-10-23T03:48:24Z","title":"Evaluating Large Language Models on Controlled Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14542","snapshot_observed_at":"2026-08-11T17:25:31.645790Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.645790Z"},"links":{"cited_paper":"/paper/2310.14542","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:000b275f06e8520c6d6df82fb8977e25c09ca31d4aaee5b9f365223e948ab12f","observation_id":"29a4a05b-dc45-474b-8d11-7feff824a42e","resolution":{"observed_at":"2026-08-11T17:25:31.645790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08440","last_updated":"2024-10-17T07:00:19Z","snapshot_observed_at":"2026-08-12T23:24:15.964750Z","submitted_at":"2024-07-11T12:26:55Z","title":"Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08440","snapshot_observed_at":"2026-08-11T17:25:31.650877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.650877Z"},"links":{"cited_paper":"/paper/2407.08440","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:d0fa011459e0ca2dbd3e752fbd361c70e38eebd52dfcc712847ba377d82993df","observation_id":"ff534545-f620-4513-9392-6df483194e48","resolution":{"observed_at":"2026-08-11T17:25:31.650877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13048","last_updated":"2021-06-03T19:15:08Z","snapshot_observed_at":"2026-08-13T20:40:11.154725Z","submitted_at":"2020-12-24T00:55:46Z","title":"ProofWriter: Generating Implications, Proofs, and Abductive Statements over Natural Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13048","snapshot_observed_at":"2026-08-11T17:25:31.657742Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.657742Z"},"links":{"cited_paper":"/paper/2012.13048","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:f27be9c6c3d73d1511d8ce7380e89107d2ac76128d24e944045be8e09a4febcb","observation_id":"93c81ae0-192f-4a1e-a76b-4770122d047f","resolution":{"observed_at":"2026-08-11T17:25:31.657742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08963","last_updated":"2024-04-04T21:57:12Z","snapshot_observed_at":"2026-08-14T13:01:11.383688Z","submitted_at":"2023-09-16T11:31:58Z","title":"Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08963","snapshot_observed_at":"2026-08-11T17:25:31.663743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.663743Z"},"links":{"cited_paper":"/paper/2309.08963","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:974aaa7cd636848bb8f14d4660d0e15313426946662a7fe0b4804dadb74cfe39","observation_id":"1cfbde95-e41a-4638-a9fc-2b37c86c2a4e","resolution":{"observed_at":"2026-08-11T17:25:31.663743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T17:25:31.669363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.669363Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c924052f4b1215e40378ada0a338b2171dfb634190968e7f4fbaa91d4547151f","observation_id":"ecbe2bb7-1901-4741-8d75-912bb2e577b5","resolution":{"observed_at":"2026-08-11T17:25:31.669363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:25:31.674596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.674596Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:822b8c3307f0aa177744c1f76a3e8122f32c18c25732bbd5d9432e2bb5be14e9","observation_id":"e0baaebf-292d-4d06-a7f2-7c8db95538c2","resolution":{"observed_at":"2026-08-11T17:25:31.674596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-08-10T13:24:05.354678Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-08-11T17:25:31.679713Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.679713Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:476964f6c5d7d8e1070013c657f90e2adc828d25527f2628c1a1404fc9974f5f","observation_id":"d1b92c73-8178-4984-90f9-730491d49f0c","resolution":{"observed_at":"2026-08-11T17:25:31.679713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13654","last_updated":"2024-08-24T19:11:54Z","snapshot_observed_at":"2026-08-14T08:22:31.377543Z","submitted_at":"2024-08-24T19:11:54Z","title":"Symbolic Working Memory Enhances Language Models for Complex Rule Application","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13654","snapshot_observed_at":"2026-08-11T17:25:31.685026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.685026Z"},"links":{"cited_paper":"/paper/2408.13654","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:73175273a326d885b63f176eb1ebd8cac244569ad35c8c1b704b98ae1b34f7d5","observation_id":"c88a85ba-37a6-4566-a606-1ce458d5726c","resolution":{"observed_at":"2026-08-11T17:25:31.685026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-11T17:25:31.690218Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.690218Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:5301ad380fdb39f6acc5bb694be4139e3b71e642888a416b97b4ab6681c99bf3","observation_id":"c782645d-ffea-4ab0-b09b-eed7f272ade5","resolution":{"observed_at":"2026-08-11T17:25:31.690218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03846","last_updated":"2023-03-08T07:37:43Z","snapshot_observed_at":"2026-08-13T12:29:57.122699Z","submitted_at":"2023-03-07T12:24:17Z","title":"Larger language models do in-context learning differently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03846","snapshot_observed_at":"2026-08-11T17:25:31.695578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.695578Z"},"links":{"cited_paper":"/paper/2303.03846","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:18ffde563b1dc1bf1786c371832014fc834cee883d756ed0e8c175a54e551343","observation_id":"1a85ad85-4774-4a3b-9fa8-dffe70884ab0","resolution":{"observed_at":"2026-08-11T17:25:31.695578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03978","last_updated":"2024-10-31T08:11:04Z","snapshot_observed_at":"2026-08-12T23:28:45.822390Z","submitted_at":"2024-07-04T14:50:45Z","title":"Benchmarking Complex Instruction-Following with Multiple Constraints Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03978","snapshot_observed_at":"2026-08-11T17:25:31.700799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.700799Z"},"links":{"cited_paper":"/paper/2407.03978","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:b6cf25fb75890a68332a17a3301be99cb83dc2391aad80542c2b6ca654457894","observation_id":"4cdb2072-3836-4bf3-93a8-6fbb1f18f0f0","resolution":{"observed_at":"2026-08-11T17:25:31.700799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:25:32.567641Z","title":null,"venue":null,"work_id":"1a0cdb69-17e1-4ee4-973b-0b34cb394c80","year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.706510Z"},"links":{"citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:ac70500428a61e86e2aab4b66211e8d079b4e82abc3dcd8009344032ddff077a","observation_id":"89f1b186-2986-43fc-b091-9e364538064d","resolution":{"observed_at":"2026-08-11T17:25:32.573102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13670","last_updated":"2025-05-29T03:19:42Z","snapshot_observed_at":"2026-08-12T14:04:58.110354Z","submitted_at":"2024-12-18T09:53:12Z","title":"AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13670","snapshot_observed_at":"2026-08-11T17:25:31.711425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.711425Z"},"links":{"cited_paper":"/paper/2412.13670","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:7e98a7f33f68fb07b94b6bc1947c3fd916574777851525bf05ecf298aa75f5e8","observation_id":"5c57647e-2132-4c7d-9d04-3f09215c7e4b","resolution":{"observed_at":"2026-08-11T17:25:31.711425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18667","last_updated":"2024-02-28T19:23:27Z","snapshot_observed_at":"2026-08-13T04:07:54.122807Z","submitted_at":"2024-02-28T19:23:27Z","title":"FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18667","snapshot_observed_at":"2026-08-11T17:25:31.716582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.716582Z"},"links":{"cited_paper":"/paper/2402.18667","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:2f4768007015a20847e1e19c7f31eac9b857af1c2e6226dd649015106fa49aa3","observation_id":"3ffddade-a12f-4d0c-822a-75a995be22b8","resolution":{"observed_at":"2026-08-11T17:25:31.716582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-11T17:25:31.721684Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.721684Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:addff4116bbe7a84eb0ff3683c5fab1c450aaf27bee1efa61ee6960e2e57fe1e","observation_id":"f9aa2e2f-1cc9-4ae8-9b06-958f5effb3e4","resolution":{"observed_at":"2026-08-11T17:25:31.721684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11436","last_updated":"2024-06-18T04:41:07Z","snapshot_observed_at":"2026-08-13T23:03:12.444829Z","submitted_at":"2024-02-18T03:10:39Z","title":"Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11436","snapshot_observed_at":"2026-08-11T17:25:31.727116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.727116Z"},"links":{"cited_paper":"/paper/2402.11436","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:c71b3aeb75086b48b13f115da3ee3667e0c55ee6b096d0cae902d67dc901d376","observation_id":"a8f55908-4f7a-4154-a59b-33998ccec510","resolution":{"observed_at":"2026-08-11T17:25:31.727116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10873","last_updated":"2025-07-13T05:18:48Z","snapshot_observed_at":"2026-08-13T05:48:01.312971Z","submitted_at":"2023-10-16T22:53:54Z","title":"IDEAL: Influence-Driven Selective Annotations Empower In-Context Learners in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10873","snapshot_observed_at":"2026-08-11T17:25:31.732283Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.732283Z"},"links":{"cited_paper":"/paper/2310.10873","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:82c3ae4b73ef0655f1fa9a16fc6ae4bb875fb7f84dd5b7c4fc8e58ada60444fa","observation_id":"844f10de-a47f-4635-bcba-4a3297884042","resolution":{"observed_at":"2026-08-11T17:25:31.732283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14198","last_updated":"2024-10-18T06:25:27Z","snapshot_observed_at":"2026-08-12T22:20:21.632613Z","submitted_at":"2024-10-18T06:25:27Z","title":"Supervised Chain of Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14198","snapshot_observed_at":"2026-08-11T17:25:31.737463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.737463Z"},"links":{"cited_paper":"/paper/2410.14198","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:09b469d4f5b527822ca2de59dab4fc847d75549b709623f194f6e3e1087f4289","observation_id":"384d583b-315a-4a8a-adf5-48678e0a6465","resolution":{"observed_at":"2026-08-11T17:25:31.737463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-11T17:25:31.742515Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.742515Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:becdf2088d437606e9ffcadfad5a9a2513233d72f390b159ebccd2c5e2ffca63","observation_id":"73562581-8cd3-4c46-b5f0-be198b988482","resolution":{"observed_at":"2026-08-11T17:25:31.742515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06598","last_updated":"2021-04-15T02:21:45Z","snapshot_observed_at":"2026-08-13T19:40:14.719019Z","submitted_at":"2021-04-14T02:53:32Z","title":"AR-LSAT: Investigating Analytical Reasoning of Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06598","snapshot_observed_at":"2026-08-11T17:25:31.747587Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.747587Z"},"links":{"cited_paper":"/paper/2104.06598","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:1a20f8bd751c604068eef407ddc21d1cfea798143e26412b34c9d8b49cd43421","observation_id":"85d4fd0c-8c37-4866-b2a1-3e3105cc69c4","resolution":{"observed_at":"2026-08-11T17:25:31.747587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-11T17:25:31.752696Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.752696Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:fe165655b8e029cecfab730b54d0e0c73d4af2b43c2301f91fa9a1b722615f74","observation_id":"74a6d8bb-5218-4579-9c27-2f087c4131ca","resolution":{"observed_at":"2026-08-11T17:25:31.752696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06221","last_updated":"2024-03-10T13:58:38Z","snapshot_observed_at":"2026-08-13T00:58:11.195838Z","submitted_at":"2024-03-10T13:58:38Z","title":"TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06221","snapshot_observed_at":"2026-08-11T17:25:31.757823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.757823Z"},"links":{"cited_paper":"/paper/2403.06221","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:fddb721951fd414c9fa81b16d829f6298b7337ac5b92fa998cf6d8e2357219c8","observation_id":"ab0a5149-1d39-483d-bf07-d5ecd39f7b4f","resolution":{"observed_at":"2026-08-11T17:25:31.757823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-14T13:25:40.761267Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-11T17:25:31.762978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T17:25:31.762978Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2412.08972"},"observation_digest":"sha256:662352fcf0bd0244376b23e171fe734e380dd84f38d003dd967f418082a91452","observation_id":"7b10c5b1-eb13-437b-a2d3-e8c4a2892122","resolution":{"observed_at":"2026-08-11T17:25:31.762978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08972","last_updated":"2025-05-30T17:43:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T18:27:11.634988Z","submitted_at":"2024-12-12T06:08:46Z","title":"RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2412.08972."}