{"as_of":"2026-08-18T15:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1541fdd7a6db8b3d8a62ce68b24e38721392c88ce851fba534076ab31d898c07","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:40:08.960042Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:33:04.549851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:31:29.370868Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2506.15455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15455","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-imagine: Symbolic benchmark synthesis for reasoning evaluation","venue":null,"work_id":"f9de58be-971f-4ef8-a7d4-dbad0414791e","year":2025},"citing_paper":{"arxiv_id":"2605.09079","last_updated":"2026-05-09T17:39:26Z","snapshot_observed_at":"2026-08-12T16:31:27.619967Z","submitted_at":"2026-05-09T17:39:26Z","title":"CauSim: Scaling Causal Reasoning with Increasingly Complex Causal Simulators","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T02:33:04.549851Z"},"links":{"cited_paper":"/paper/2506.15455","citing_paper":"/paper/2605.09079"},"observation_digest":"sha256:0625f75ff873555b06d9fd5be3b0f71eaf7f3b68d921516bcbdfeda5acac5bac","observation_id":"c4061381-fefe-4817-97eb-c3eb4dfb5b28","resolution":{"observed_at":"2026-05-12T07:31:29.417099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15455/citation-record","integrity":"/paper/2506.15455/integrity","json":"/paper/2506.15455/citation-record.json","paper":"/paper/2506.15455"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.868885Z","title":"R., Bury, G., and de Oliveira, S","venue":null,"work_id":"33435e74-127b-4bb5-ad32-280f878dff79","year":2022},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.689919Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:77dec92e6094383bd50787b5b51ed41e521dca293511e04640210e472e1c856a","observation_id":"ddbf1f6e-1568-4b8c-aa5a-c9c0841fd8c5","resolution":{"observed_at":"2026-08-15T19:40:09.873549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.695478Z","title":"W., Conway, C","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.695478Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:c1c9e0b93d6f243037c2eb19262547764950b54934e3e6e912b7b5c0e75d8af9","observation_id":"2381b885-e319-4f6c-8297-873f9ea42ca3","resolution":{"observed_at":"2026-08-15T19:40:08.695478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T19:40:08.701122Z","title":"B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.701122Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:30dd87bbeb1c5776167304b370ad6ca04753409a5eb3ce3ca7ad95260ec53fb1","observation_id":"d105d418-b29a-4364-9e0c-94f1b0f1805d","resolution":{"observed_at":"2026-08-15T19:40:08.701122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04604","last_updated":"2025-01-08T05:24:50Z","snapshot_observed_at":"2026-08-16T13:00:34.704005Z","submitted_at":"2024-12-05T20:40:28Z","title":"ARC Prize 2024: Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04604","snapshot_observed_at":"2026-08-15T19:40:08.712175Z","title":"Arc prize 2024: Technical report, 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.712175Z"},"links":{"cited_paper":"/paper/2412.04604","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:d2c1ef7338a7533fbde9e103bdd9221d47af1ce76a3959480606c95f568dd7fe","observation_id":"093aa8cc-8502-430e-8dc4-8b91fd908bca","resolution":{"observed_at":"2026-08-15T19:40:08.712175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T19:40:08.718055Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.718055Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:7ad19cd128aaba4b4bfbea643221798ca2a91f660d40de99460e15961b606489","observation_id":"4dd80ccd-e603-498b-9189-6bff78f6520e","resolution":{"observed_at":"2026-08-15T19:40:08.718055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.853506Z","title":"Frama-C User Manual","venue":null,"work_id":"f34b4065-e93f-44d6-be52-23ec005f4c2b","year":null},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.724358Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:772e8f9a3fad046157c0c151e17b4464cd922c648907a503a9381e2d2c4f8cb1","observation_id":"c5f468f4-fa2c-475f-9d64-aabb0718792d","resolution":{"observed_at":"2026-08-15T19:40:09.858155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.838700Z","title":"and Bj rner, N","venue":null,"work_id":"249fd926-5c02-4ebc-9e49-0def1d520b5f","year":2008},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.729888Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:5db63ee244f0c9c7e8776f035299c953c88ff137cf5940047c5ee2a0a1f8e948","observation_id":"943f825b-4d28-40e9-b3d8-3642a7307cf8","resolution":{"observed_at":"2026-08-15T19:40:09.843181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.735136Z","title":"Pal: Program-aided language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.735136Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:929dfea53f3d12b85e78e1ec3585795a9b6abc741bab7fffe02dcf0b40042bde","observation_id":"88085062-9a74-4f6e-9941-bfa10bedabfd","resolution":{"observed_at":"2026-08-15T19:40:08.735136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-15T19:40:08.739793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.739793Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:f375e4ca13deae4f5f2d7f53a23dac04123dedf1b225f6d6c79b60b524f9e06c","observation_id":"435a24fe-d609-42ce-8590-fbf85262dc76","resolution":{"observed_at":"2026-08-15T19:40:08.739793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.811641Z","title":"and Nori, A","venue":null,"work_id":"b41d876c-04c7-47cf-97fa-18b4490aad39","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.745800Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:0abb5ecc92ab4ade54aa7e74710237141c1436d1724d1cca7b05050ae08460bd","observation_id":"f64170b5-00a4-4fcb-bc32-35d9dccd9b8d","resolution":{"observed_at":"2026-08-15T19:40:09.816741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-08-17T23:54:36.836170Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-15T19:40:08.751296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.751296Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:25a6579a523af1a520c40c0917fd0313591ba14f6e89192fd20da4603f84500a","observation_id":"f8d38a5b-76cd-4e68-a40e-cdd22d670ef3","resolution":{"observed_at":"2026-08-15T19:40:08.751296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.795504Z","title":null,"venue":null,"work_id":"a90d4d96-8ac4-4f2e-9b79-7a59cdf8c65d","year":2005},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.756971Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:cf64cdf787a812b8a2fbe9d271e40e3787f46f7bdfad763f996680f59e2d64ff","observation_id":"07508454-5ca7-42f2-b098-135814e255b0","resolution":{"observed_at":"2026-08-15T19:40:09.800701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T19:40:08.761512Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.761512Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:bf05ab1e5c5f21cdc108277d9d8441833b6eacb7e704fec889790e6b381eeb7f","observation_id":"c5ed88e9-ccea-43a8-91e9-faa147a13958","resolution":{"observed_at":"2026-08-15T19:40:08.761512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.780775Z","title":null,"venue":null,"work_id":"7b742959-048a-46f5-952b-cca28bd98f68","year":2005},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.766707Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:4ee43deb9082c37d152e84d9b18da5b124698260f1ef91c103fdc2acdb20c231","observation_id":"06e2c178-e753-4b85-aafe-13851bc0c9c5","resolution":{"observed_at":"2026-08-15T19:40:09.785238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.764677Z","title":"and Chang, K","venue":null,"work_id":"9c51c0da-0d24-402f-99fb-3c947785fc38","year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.771276Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:e59895be97f86075298cc84289529775e3e68d63a3fadc0b4b246808d3d96446","observation_id":"3d052235-c979-4078-8646-9c3386e45677","resolution":{"observed_at":"2026-08-15T19:40:09.770621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03767","last_updated":"2025-03-15T18:40:04Z","snapshot_observed_at":"2026-08-16T13:13:18.281301Z","submitted_at":"2024-10-02T15:33:30Z","title":"Reasoning Elicitation in Language Models via Counterfactual Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03767","snapshot_observed_at":"2026-08-15T19:40:08.775606Z","title":"V., and González, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.775606Z"},"links":{"cited_paper":"/paper/2410.03767","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:2f873d6d19318c2b16d982c624565abcd8952f7750f71a4fc7923c789f1475e8","observation_id":"d27b7724-7963-4f98-8403-8e4a37cc09ff","resolution":{"observed_at":"2026-08-15T19:40:08.775606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T19:40:08.780223Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.780223Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:fbe8894ca5202021e08a9dbdceb0449d2e752fb90719b646765c0aeb6ce65a06","observation_id":"a7b1354a-4af1-4c76-a11d-3fc8eba53a1e","resolution":{"observed_at":"2026-08-15T19:40:08.780223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T19:40:08.785242Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.785242Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:e1aa08dbc687912e8907639754cb930ea8dd7854f86aa82d74bf389ea6c046a4","observation_id":"642a3b46-ff66-4b87-ba54-aa4de3f64724","resolution":{"observed_at":"2026-08-15T19:40:08.785242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.748236Z","title":"CL adder: A ssessing causal reasoning in language models","venue":null,"work_id":"a174d515-e658-4d75-9b99-cfab59575e11","year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.790448Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:ee3bee842e5d355d345213f34bc370222d7039e9164c5d3f1a7e4646a840b294","observation_id":"090750a8-9089-4a49-b893-9470231d6c42","resolution":{"observed_at":"2026-08-15T19:40:09.753221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.732708Z","title":"Cladder: Assessing causal reasoning in language models","venue":null,"work_id":"d6744aef-387b-46f9-8c92-496927d2daa9","year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.795666Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:ca6cb2eae41aa2c567f93cbaabb8bc252a3d35f8ca2f4e6f3cf3d2449657fa26","observation_id":"2e2ef2bd-6003-4140-a8c8-00c2322b0400","resolution":{"observed_at":"2026-08-15T19:40:09.737804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.716080Z","title":"K., Lal, A., Rastogi, A., Roy, S., and Sharma, R","venue":null,"work_id":"ec7fe6c0-f2dc-4a09-a1d9-ed64c26b0fe6","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.800802Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:380fe9272a72805b81dae7ed5f178db5d6b12125ec10bc629404d33aff342916","observation_id":"2beb983d-a1a4-4049-b534-a759dcb5d27a","resolution":{"observed_at":"2026-08-15T19:40:09.721492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.699846Z","title":"S., Iwafuchi, T., and Dasaka, S","venue":null,"work_id":"699e3cba-0321-4a2b-8904-810487b6aef6","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.805630Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:c26097a21002522c2cee35c0e8de52aa4d37514ba23cc997f9970888ec860d6a","observation_id":"4ddb2491-b701-47ec-aa87-d8435e90b864","resolution":{"observed_at":"2026-08-15T19:40:09.704735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14215","last_updated":"2024-11-21T15:25:08Z","snapshot_observed_at":"2026-08-16T20:56:25.213423Z","submitted_at":"2024-11-21T15:25:08Z","title":"Evaluating the Robustness of Analogical Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14215","snapshot_observed_at":"2026-08-15T19:40:08.810909Z","title":"and Mitchell, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.810909Z"},"links":{"cited_paper":"/paper/2411.14215","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:ed9ce49bae19fc3c2e65f17f8079a18d2275cdf12805e20585d840ba6cf73b46","observation_id":"9a86c7f8-cdb4-41b4-8f8b-aa64fa20bf1f","resolution":{"observed_at":"2026-08-15T19:40:08.810909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04857","last_updated":"2024-12-06T08:49:49Z","snapshot_observed_at":"2026-08-18T09:40:39.578706Z","submitted_at":"2024-12-06T08:49:49Z","title":"Neuro-Symbolic Data Generation for Math Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04857","snapshot_observed_at":"2026-08-15T19:40:08.816339Z","title":"Neuro-symbolic data generation for math reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.816339Z"},"links":{"cited_paper":"/paper/2412.04857","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:fda6cdd4ca3f3a434dc218e550b4b6716b585cae108aefdf01f940d1a7d81206","observation_id":"d1fc62b6-3321-49b9-9bba-357dee2558d7","resolution":{"observed_at":"2026-08-15T19:40:08.816339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-16T08:54:56.543625Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-15T19:40:08.822965Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.822965Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:9500174730f0b4c362ccfc0173575166f4ee440c0799026029f286445335109b","observation_id":"59c2d6a5-0701-4cba-8c75-58abf932f19a","resolution":{"observed_at":"2026-08-15T19:40:08.822965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.831764Z","title":"and Krakauer, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.831764Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:cb737e032e1c495c996c67053c82e077b0d63ae139d251bf4b1fdc7e427d7a83","observation_id":"7768b750-28d6-462d-bcc5-618e68af04a7","resolution":{"observed_at":"2026-08-15T19:40:08.831764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.684486Z","title":null,"venue":null,"work_id":"28552fdc-812b-43ca-96ee-37c6cd85dbcc","year":2000},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.837698Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:1f99017c4b93e695e47bae14d65196328ec896d62dc2ec34a07a5d00083b0df0","observation_id":"5872c196-5e25-4f84-8f6c-fcd1ae19b23a","resolution":{"observed_at":"2026-08-15T19:40:09.689055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.669101Z","title":"Early access for safety testing, December 2024","venue":null,"work_id":"a09bdc97-0d8f-439e-bea5-b246d4057372","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.843262Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:e6d8a9d49d0529689debbcfc1ae1645b566cfe5ecb0b606f0ed9afd10c893a8d","observation_id":"2224da54-95cf-4457-aa8f-41ff87b27d6e","resolution":{"observed_at":"2026-08-15T19:40:09.673975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.653267Z","title":"Causality: Models, Reasoning, and Inference","venue":null,"work_id":"ab493d0d-e333-48fd-a3b3-3b69d191e28f","year":2009},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.850804Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:35667646e95871352c3ab0b81bb37f178ddba7738b983074f248805ed83ead83","observation_id":"937d3089-5f2d-41ef-be73-f553e88a3b49","resolution":{"observed_at":"2026-08-15T19:40:09.658383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.637646Z","title":null,"venue":null,"work_id":"cb58d354-8395-43f0-bcdb-f037b5fb0376","year":2000},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.855943Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:4b8e68445a637e1e7b29d5f7e3dbb8a70c0e07b87e6daa7703b607f518ee0491","observation_id":"bddd8586-dd46-4de4-9514-4eab8ee8a31d","resolution":{"observed_at":"2026-08-15T19:40:09.642596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.861834Z","title":"H., Sch \\\"a rli, N., and Zhou, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.861834Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:fdefd2340d2277fddc78ac14ab42d61f74fc4a0f1c0f5104d3ed2a883d0427fc","observation_id":"6487c19c-4d19-4863-8480-e70788761d82","resolution":{"observed_at":"2026-08-15T19:40:08.861834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.611121Z","title":"Learning loop invariants for program verification","venue":null,"work_id":"d0d48dd4-2f74-4832-8135-763710dfcc35","year":2018},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.866989Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:3c003ab7a7ab9bd22e39c8b5305acda3d7d58e721a2dd17dcf7daca0068a3c83","observation_id":"1643a9a5-dc38-4d8a-bdbc-dd73937182e8","resolution":{"observed_at":"2026-08-15T19:40:09.616359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-15T19:40:08.873201Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.873201Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:1bc10d9149ed8eb8b5b4e10a0ac4086124fbb9dbce660f998a4e4cf37e211298","observation_id":"d6d33143-d23d-4653-83cb-12b5ccb956eb","resolution":{"observed_at":"2026-08-15T19:40:08.873201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-08-16T14:14:00.628545Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-15T19:40:08.878802Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.878802Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:e0a4cec1b0590c0c5159615951dc54f4aecc34d634adb3c204573e278a490feb","observation_id":"d0f7b3b7-7f7a-47db-b0b7-a4d04739393c","resolution":{"observed_at":"2026-08-15T19:40:08.878802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.594200Z","title":null,"venue":null,"work_id":"b1165cff-c975-4a7f-a256-7f422b10159a","year":2025},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.883832Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:b0e7163487a8485ffa563eda7c8e18d00df9ef1bc097c01142edf9a2f9b593ea","observation_id":"4ed2bb3d-7c5c-4da1-a6b6-8c9ebe52b141","resolution":{"observed_at":"2026-08-15T19:40:09.600363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10176","last_updated":"2024-11-03T03:48:02Z","snapshot_observed_at":"2026-08-16T17:24:49.433939Z","submitted_at":"2024-02-15T18:26:11Z","title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10176","snapshot_observed_at":"2026-08-15T19:40:08.889506Z","title":"Openmathinstruct-1: A 1.8 million math instruction tuning dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.889506Z"},"links":{"cited_paper":"/paper/2402.10176","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:269df89e4b57140d86aa8cf14be703c5177cd7f59481441189d8f785270c9c77","observation_id":"0f75384e-28e4-4293-a4f9-85957ff60ff1","resolution":{"observed_at":"2026-08-15T19:40:08.889506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T19:40:08.894465Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.894465Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:153c5a83a004eaee1151e17d9e07010f1dde0a68fc7a1107e4c1adb124d1ce89","observation_id":"392b4c00-9a6b-4a73-94e5-3e4382f23feb","resolution":{"observed_at":"2026-08-15T19:40:08.894465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.899748Z","title":"Large language models still can't plan (a benchmark for llms on planning and reasoning about change)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.899748Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:9ee8f6ce70bd235dc0a178e7edfc91cc6ef5d459e615fa2bf551d7a492000086","observation_id":"ad0bbeb9-04a3-49cb-92d9-0f6e86c588a1","resolution":{"observed_at":"2026-08-15T19:40:08.899748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-08-17T22:08:45.245439Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-15T19:40:08.905494Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.905494Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:707d191dde6e3e4891ecf9f27003b161acb6efecacb64126407b59164bb4030f","observation_id":"781fbb60-726c-4f75-9846-b3c7e080dce3","resolution":{"observed_at":"2026-08-15T19:40:08.905494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.910833Z","title":"S., and Momennejad, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.910833Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:2693db04e59f5caf8ff55aa7c67c7fd35282b1d32d57bc44d5fcd10617aab3f4","observation_id":"d32efc91-9715-49a1-8a1c-6d301bf0d49b","resolution":{"observed_at":"2026-08-15T19:40:08.910833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-15T19:40:08.916015Z","title":"Ethical and social risks of harm from language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.916015Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:42b6e88088513a28d88a3aea440a7224b22ec91a373e038a666961d6f640df95","observation_id":"133e0d5b-1916-4682-8c01-99c2cee94f08","resolution":{"observed_at":"2026-08-15T19:40:08.916015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.561847Z","title":"W., and Narodytska, N","venue":null,"work_id":"6c9a576c-bff1-434a-a107-bf17f5cf93b1","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.921815Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:7954173cfbe19fd120667a1de7c81d2ee9d7f0caa9a13bb2afa895b37959d679","observation_id":"f4654180-7874-405f-bb9a-19f45f7a8b41","resolution":{"observed_at":"2026-08-15T19:40:09.571359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02477","last_updated":"2024-03-28T23:37:24Z","snapshot_observed_at":"2026-08-18T04:28:41.362512Z","submitted_at":"2023-07-05T17:50:42Z","title":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02477","snapshot_observed_at":"2026-08-15T19:40:08.926155Z","title":"Reasoning or reciting? exploring the capabilities and limitations of language models through counterfactual tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.926155Z"},"links":{"cited_paper":"/paper/2307.02477","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:d743d32d529e8888c182605ad514df932d6cd80c182e1ab627138452a48a4edb","observation_id":"79947bfb-2d7a-4a18-af7f-dfa847721a23","resolution":{"observed_at":"2026-08-15T19:40:08.926155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-15T19:40:08.930958Z","title":"Towards large reasoning models: A survey on scaling llm reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.930958Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:0843a19651897cdecc58db44e941f73e567ec4a295944f5a447250b2386e8b37","observation_id":"893ab7e0-d663-4c55-a758-b0b5384e1de0","resolution":{"observed_at":"2026-08-15T19:40:08.930958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.543613Z","title":"A critical review of causal reasoning benchmarks for large language models","venue":null,"work_id":"4802d519-1c2b-4a2c-8283-a2e89ef0e384","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.935588Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:93a7bd8c127461fa75d679100b926332c848237416614d9a5dc997dc660d9153","observation_id":"4e615cad-e6a8-4121-a107-abada2f49625","resolution":{"observed_at":"2026-08-15T19:40:09.549227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.525821Z","title":"Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process","venue":null,"work_id":"aa4f2cd8-db71-49c7-8fae-b29c3fb29cfd","year":2025},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.940762Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:5e457f40fd6caf3a9cc6afdda92f5dd7241ff280832ee0395af568d803f5943e","observation_id":"4b8e9cfd-c774-44d1-8dd6-88ea535ca356","resolution":{"observed_at":"2026-08-15T19:40:09.531174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.507411Z","title":"Darg: Dynamic evaluation of large language models via adaptive reasoning graph, 2024","venue":null,"work_id":"d87d7fea-8492-4695-b467-c3a0ea5fe4d6","year":2024},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.945218Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:b3d4bb08fa5a9538df8a8e0cfe13822a007ddf9e6bd18470df70ccd306e661d8","observation_id":"291ca5db-d6a9-4d6b-a301-bf01ab4ce05f","resolution":{"observed_at":"2026-08-15T19:40:09.513963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-16T14:46:11.658740Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-15T19:40:08.949778Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.949778Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:b7a0f648813781ade2dc23da80a4785bf8133537b28c710abfacbfd7b5e7afc3","observation_id":"a4c3e969-c9c0-40db-a937-ddacf53dfa8e","resolution":{"observed_at":"2026-08-15T19:40:08.949778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:09.489391Z","title":"Z., Yang, D., and Xie, X","venue":null,"work_id":"e4943b8c-7768-47bb-b9ff-b8a73e3aac28","year":2023},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.955088Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:a50df98357f31bfd87b6df3d9db38274a96e1a35be03252a6cba4f0ac91ea3cf","observation_id":"bf2d0fb5-43c7-4713-9fbc-d07cdf0f3425","resolution":{"observed_at":"2026-08-15T19:40:09.495937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:40:08.960042Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T19:40:08.960042Z"},"links":{"citing_paper":"/paper/2506.15455"},"observation_digest":"sha256:2e5cf6ce9c59906a8dd914c1494b4ca389b912e4827b221fde6fefcbb8bed5aa","observation_id":"8dc153de-a210-45bf-b931-341a7a45cb56","resolution":{"observed_at":"2026-08-15T19:40:08.960042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15455","last_updated":"2025-06-18T13:35:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T23:10:36.299673Z","submitted_at":"2025-06-18T13:35:47Z","title":"RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.15455."}