{"as_of":"2026-08-11T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0f44da23c44008a0984ab853d13c67486bc451cca08c586e1580ed1729e8d91","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:26.743983Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:34:29.377709Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24147","snapshot_observed_at":"2026-08-04T19:34:29.377709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09193","last_updated":"2025-09-11T07:09:30Z","snapshot_observed_at":"2026-08-07T07:37:18.552922Z","submitted_at":"2025-09-11T07:09:30Z","title":"AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T19:34:29.377709Z"},"links":{"cited_paper":"/paper/2505.24147","citing_paper":"/paper/2509.09193"},"observation_digest":"sha256:c4748927168ecc3961a331ee257c94683f541715dddbe8d4e30395304b61f533","observation_id":"b57b68c9-4876-41b3-a345-711e53062310","resolution":{"observed_at":"2026-08-04T19:34:29.377709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24147/citation-record","integrity":"/paper/2505.24147/integrity","json":"/paper/2505.24147/citation-record.json","paper":"/paper/2505.24147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.01193","last_updated":"2018-12-06T16:11:19Z","snapshot_observed_at":"2026-08-10T11:18:37.679975Z","submitted_at":"2018-12-04T03:15:38Z","title":"e-SNLI: Natural Language Inference with Natural Language Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01193","snapshot_observed_at":"2026-08-07T12:40:19.931343Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:19.931343Z"},"links":{"cited_paper":"/paper/1812.01193","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:47a8d7eff2bd59d961b8f612bfa7d2b9c28c90d5878823ee8157e8c5c1bf6233","observation_id":"9a44730b-7cb5-4230-966a-77be09148183","resolution":{"observed_at":"2026-08-07T12:40:19.931343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00071","last_updated":"2022-03-28T19:58:03Z","snapshot_observed_at":"2026-07-06T12:13:53.244607Z","submitted_at":"2021-11-30T20:09:53Z","title":"What to Learn, and How: Toward Effective Learning from Rationales","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00071","snapshot_observed_at":"2026-08-07T12:40:20.075543Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.075543Z"},"links":{"cited_paper":"/paper/2112.00071","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e00ac11d39e188159973cdaa8cc99263624567f33ad95032f884f742039830ff","observation_id":"28d0f066-cc60-472f-9c0d-2ef3ed4c4ee9","resolution":{"observed_at":"2026-08-07T12:40:20.075543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T12:40:20.235803Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.235803Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:5d4d68eb512d6e02e1488cdb657c4ada9d35f8ee974f1c84c6f5000985583221","observation_id":"b611289b-cd53-4d9f-a96c-9463267bb6f7","resolution":{"observed_at":"2026-08-07T12:40:20.235803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:40:20.376449Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.376449Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:64448199cd1c6e2b865ef2ef08066e9cd83c24b3d86e3be75d58af067c8e4dda","observation_id":"161dc58f-b8ea-435b-a4cf-80d4c290baf4","resolution":{"observed_at":"2026-08-07T12:40:20.376449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:40:20.478762Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.478762Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e17c7adb9fd2fe3575c6ece1dcfb23610b82500ee04f9e8bbb52df9f7a3d9a72","observation_id":"561e22a8-88ba-42ab-b917-6760969e44fa","resolution":{"observed_at":"2026-08-07T12:40:20.478762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.937498Z","title":null,"venue":null,"work_id":"1136dc03-180f-4220-9ebd-af85be9794d3","year":1983},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.563230Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:9b4c5f615476af863493c2a8ba4521756b99da77748edeadd2037132208f0ad1","observation_id":"9b199d19-f52f-4282-bdf3-034b538f339a","resolution":{"observed_at":"2026-08-07T12:40:29.046299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07892","last_updated":"2020-10-15T17:04:21Z","snapshot_observed_at":"2026-08-11T00:34:41.716086Z","submitted_at":"2020-03-17T18:58:44Z","title":"Calibration of Pre-trained Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07892","snapshot_observed_at":"2026-08-07T12:40:20.670222Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.670222Z"},"links":{"cited_paper":"/paper/2003.07892","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:917dd420165988ae1a7504e0fe19711bbab96f12e7c04dcbe8d2355773a08809","observation_id":"80f18ef8-7ff6-4e65-a87e-96e0cadb69c5","resolution":{"observed_at":"2026-08-07T12:40:20.670222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:20.771006Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.771006Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:62a704d257450cc284a9e5b554a29b6007050b50051e3cf7808953500a5e2a05","observation_id":"c2a9bc4f-3040-4ad6-8cef-9b049892a534","resolution":{"observed_at":"2026-08-07T12:40:20.771006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.748756Z","title":null,"venue":null,"work_id":"f0a96414-351c-4c96-8b31-3450060abbe5","year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.902134Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:a2f7a400a955e4989010ec92b258b3e2c6726bf49e7d06dc6acb0cbeff50c72a","observation_id":"38c17928-dfe3-4ca3-a413-5c551fbef8a9","resolution":{"observed_at":"2026-08-07T12:40:28.841092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.539729Z","title":null,"venue":null,"work_id":"f40d57e7-3b79-4825-8479-890e6976c7bd","year":2009},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.009144Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:58e22f9b09dbb493d0087d59a3f5f51b11f0be9ba80ab374242836578b61cd29","observation_id":"32f8bb84-2b67-49b2-8150-9fde9ec8e34c","resolution":{"observed_at":"2026-08-07T12:40:28.631722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08420","last_updated":"2025-04-27T01:03:12Z","snapshot_observed_at":"2026-08-05T16:28:29.633722Z","submitted_at":"2021-10-16T00:21:42Z","title":"Understanding Dataset Difficulty with $\\mathcal{V}$-Usable Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08420","snapshot_observed_at":"2026-08-07T12:40:21.067613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.067613Z"},"links":{"cited_paper":"/paper/2110.08420","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:aa620fb9b1de0319b8b53b1ac31b59a1a2a8339fa7c883120f986ca38a4e4bb4","observation_id":"a69755ad-827a-4e21-8dd7-3121394fd948","resolution":{"observed_at":"2026-08-07T12:40:21.067613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-08-10T11:18:05.083290Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-08-07T12:40:21.135948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.135948Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:92691288c19cbfa4f3e41d66419601ad6935b68310d5ec30a53aa2f63e3d6165","observation_id":"55d64ad1-a4c2-4cb8-8a2a-f7342e66b8b9","resolution":{"observed_at":"2026-08-07T12:40:21.135948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.412510Z","title":null,"venue":null,"work_id":"61836b57-fb14-4585-aec6-d9404c230fe3","year":null},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.202033Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:96426dd2cb609f2b84e43c73805bd8550ab700b99068387c3df63b104fbbfd8f","observation_id":"5b86da8c-5c8e-4bef-aadb-2c20b1c4aaef","resolution":{"observed_at":"2026-08-07T12:40:28.468282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-09T16:28:11.835630Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-08-07T12:40:21.277381Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.277381Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:028e2150416008c162336ff7ab0008ab75db78aa6db49c801b5baf90bdeee249","observation_id":"e4d1d33d-c773-4b3c-ba0d-be347a81914f","resolution":{"observed_at":"2026-08-07T12:40:21.277381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:21.377227Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.377227Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:50640a60bd9cd9edebec95946ae0d1fe6fc984fdb5337fa5a340bb179fce72c7","observation_id":"f0f9e274-45f8-477e-8f7d-b3b34bb95c2b","resolution":{"observed_at":"2026-08-07T12:40:21.377227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19249","last_updated":"2023-05-30T17:35:31Z","snapshot_observed_at":"2026-08-10T11:19:23.815182Z","submitted_at":"2023-05-30T17:35:31Z","title":"Preserving Pre-trained Features Helps Calibrate Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19249","snapshot_observed_at":"2026-08-07T12:40:21.446432Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.446432Z"},"links":{"cited_paper":"/paper/2305.19249","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c92d27f0788e48bb0d79d36e47faf074f2bf2507a9bb998ba3a6e2738590aa63","observation_id":"6a428f17-441c-4495-b920-10589e7e418f","resolution":{"observed_at":"2026-08-07T12:40:21.446432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02136","last_updated":"2018-10-03T07:32:57Z","snapshot_observed_at":"2026-08-02T06:41:33.803920Z","submitted_at":"2016-10-07T04:06:01Z","title":"A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02136","snapshot_observed_at":"2026-08-07T12:40:21.542866Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.542866Z"},"links":{"cited_paper":"/paper/1610.02136","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:91b7452cb699ec49958aa5cbd21ba571a5ed6bc0ada696e3ca189c9b7562b85a","observation_id":"ff5be32c-c1b9-40da-9360-ab046edb059c","resolution":{"observed_at":"2026-08-07T12:40:21.542866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09553","last_updated":"2023-11-16T04:17:49Z","snapshot_observed_at":"2026-08-10T11:19:24.046434Z","submitted_at":"2023-11-16T04:17:49Z","title":"Program-Aided Reasoners (better) Know What They Know","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09553","snapshot_observed_at":"2026-08-07T12:40:21.641954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.641954Z"},"links":{"cited_paper":"/paper/2311.09553","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c6034d91b2becb44f13009e48ef1100a6a9b9fba625752108256a2b33310bc20","observation_id":"5c778750-e0b3-429c-859e-0ff7ba174de0","resolution":{"observed_at":"2026-08-07T12:40:21.641954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-07T12:40:21.763925Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.763925Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:08c7878aa2671b010ba26031a9d0e1d866d48fedbb6038a0d4de6b270e764f8a","observation_id":"87bba128-4d09-42ba-9549-726fc78a78b1","resolution":{"observed_at":"2026-08-07T12:40:21.763925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:21.915046Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.915046Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:28ace40b6e75b8ed53c166149fdc8b4bd6b0dbcc8c52cb98cac6c090d9b93f90","observation_id":"40c41778-a9c3-439d-a34e-ef9f44e289e7","resolution":{"observed_at":"2026-08-07T12:40:21.915046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-07T12:40:22.060387Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.060387Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:7ef6e381901a80e9fc4166689a07214aacb570cd9042a0f7c0ef7ffe0e48f959","observation_id":"e9521933-7c8e-4969-844a-3c985b928b30","resolution":{"observed_at":"2026-08-07T12:40:22.060387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.139969Z","title":null,"venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.139969Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:659618db4babf08d1362c7e3f8898be46bb8f6126c171f472781539a57e716d3","observation_id":"b1324cd2-e53e-4e28-a639-d7ba67a5c294","resolution":{"observed_at":"2026-08-07T12:40:22.139969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14050","last_updated":"2024-04-15T21:58:27Z","snapshot_observed_at":"2026-08-10T11:18:03.963963Z","submitted_at":"2023-06-24T20:15:07Z","title":"Symbolic Chain-of-Thought Distillation: Small Models Can Also \"Think\" Step-by-Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14050","snapshot_observed_at":"2026-08-07T12:40:22.199178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.199178Z"},"links":{"cited_paper":"/paper/2306.14050","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:630856ddccaafefed4986f3f4bbc84b15e31726c5b92afaf8f26f816d7f035e4","observation_id":"f999883d-599e-44fc-b4ce-a812673cec89","resolution":{"observed_at":"2026-08-07T12:40:22.199178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06726","last_updated":"2022-10-13T04:50:02Z","snapshot_observed_at":"2026-07-06T14:04:32.971017Z","submitted_at":"2022-10-13T04:50:02Z","title":"Explanations from Large Language Models Make Small Reasoners Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06726","snapshot_observed_at":"2026-08-07T12:40:22.245302Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.245302Z"},"links":{"cited_paper":"/paper/2210.06726","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:9dad6b4176c792ef0f04bc30e29573cf6bc24f59a91bc2e8f87e746c572778c1","observation_id":"24ab85c0-e912-44e2-93c3-5e39193b1ccd","resolution":{"observed_at":"2026-08-07T12:40:22.245302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.296911Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.296911Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:3c88f48f050fab109bf4c203f62cc394e0417a53f5aa4714a3307a722415b10a","observation_id":"0396449b-6fd5-4a27-b5a3-2a55086dec67","resolution":{"observed_at":"2026-08-07T12:40:22.296911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-08-09T07:44:02.172714Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-07T12:40:22.360176Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.360176Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:fed2530b208da16c4287678bd4d21a55f1039d2a1bd6d716264f89cc69dfaa4e","observation_id":"6d6a7199-fcda-42f4-99fb-77b23b6d8f91","resolution":{"observed_at":"2026-08-07T12:40:22.360176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.447045Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.447045Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:94a37d81532af116fc0ba95cd7942bc48dcba90940fc8d248d35d90aa620f11c","observation_id":"e86b44f5-654f-4c75-96ba-7f0641dd71f3","resolution":{"observed_at":"2026-08-07T12:40:22.447045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.242371Z","title":null,"venue":null,"work_id":"d0778a1b-b78e-4ebb-9803-16f6aeca1c64","year":1962},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.511386Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:06e366c570e52ceeabe11b3a26b527d3063d92f960a3cab29f0ef104aa48a993","observation_id":"c3a1828e-e532-4e12-b819-1f19d0b3e3fc","resolution":{"observed_at":"2026-08-07T12:40:28.323483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-08-09T03:30:58.801577Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-07T12:40:22.619372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.619372Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:ba254f1b9af8c534d29ee6963b9966d51f646b1e4da2169cc01a97ba7c286138","observation_id":"ac63deaf-e776-4267-8881-5356e894b10f","resolution":{"observed_at":"2026-08-07T12:40:22.619372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T12:40:22.734629Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.734629Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:329d293132ab8e36aa680e4a45c22ff76158c92aee456d80f36281a3c862a71a","observation_id":"d5280896-2f0b-4ca6-afa9-c0a13888ff92","resolution":{"observed_at":"2026-08-07T12:40:22.734629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.014418Z","title":null,"venue":null,"work_id":"8b19f679-b21e-4212-a9fa-8b313530ea94","year":1973},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.855226Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:484348dfb69865894b3e789ba08e69c732488d76d59cf1f635f99aaafe0bef4e","observation_id":"60471de3-a638-4f6a-b7ac-bade45924015","resolution":{"observed_at":"2026-08-07T12:40:28.117433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:23.005069Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.005069Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:44aa9727c4e3711c3a73c4401d280d6ddd7e478f50b9f13033d56d12a4a311da","observation_id":"4429db8d-9897-4509-ac80-c4e8c2f14e0e","resolution":{"observed_at":"2026-08-07T12:40:23.005069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.05154","last_updated":"2015-09-02T17:26:24Z","snapshot_observed_at":"2026-08-10T11:18:06.827925Z","submitted_at":"2015-08-21T00:25:51Z","title":"Posterior calibration and exploratory analysis for natural language processing models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.05154","snapshot_observed_at":"2026-08-07T12:40:23.140874Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.140874Z"},"links":{"cited_paper":"/paper/1508.05154","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:d4b2f4c4d4b5e0d52ad3c916ead34de0988e703b3a42ac013eb8358d59ab512b","observation_id":"fca23586-df35-4a81-a7b0-d268fe3008de","resolution":{"observed_at":"2026-08-07T12:40:23.140874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.14599","last_updated":"2020-05-06T17:01:56Z","snapshot_observed_at":"2026-08-09T04:22:29.127616Z","submitted_at":"2019-10-31T16:50:43Z","title":"Adversarial NLI: A New Benchmark for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.14599","snapshot_observed_at":"2026-08-07T12:40:23.231514Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.231514Z"},"links":{"cited_paper":"/paper/1910.14599","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:2ab6ba6235c288599486e6f5c33565cc44b384a8e4b6dd87a49e5582f97efcff","observation_id":"cdcb8956-cdec-48cc-9ecf-5808c8df91cc","resolution":{"observed_at":"2026-08-07T12:40:23.231514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.787863Z","title":null,"venue":null,"work_id":"3fd916ff-21d0-438b-828f-62074b76c689","year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.314380Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:0677f1000db4e49c7e0c3653e72e355faa47b4197f4619a5faed7cb88c1fe788","observation_id":"79fd8426-6614-4db8-bae0-9f1c6b8b9c99","resolution":{"observed_at":"2026-08-07T12:40:27.897090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-07T12:40:23.408330Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.408330Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:ce37e2af126faa9c4325235e4224d233ac61f36432ab4e9a977aa5389f93838e","observation_id":"1daaaa3f-9a28-40db-8c6b-1d23294a8688","resolution":{"observed_at":"2026-08-07T12:40:23.408330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01653","last_updated":"2021-09-03T17:56:40Z","snapshot_observed_at":"2026-08-04T08:05:07.544242Z","submitted_at":"2021-09-03T17:56:40Z","title":"CREAK: A Dataset for Commonsense Reasoning over Entity Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01653","snapshot_observed_at":"2026-08-07T12:40:23.494889Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.494889Z"},"links":{"cited_paper":"/paper/2109.01653","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:80f5319ecf51cfd88b09d7a71346be1dfd16bbffc589706688e2292d25f06dd3","observation_id":"aee1e717-c13b-424d-9560-f2696fb8047d","resolution":{"observed_at":"2026-08-07T12:40:23.494889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:40:23.653922Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.653922Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:49f971552f83eeef4d549608978b7cfa9a850faeb2342b8867d0b50b12332f4b","observation_id":"9c942df4-bfc7-49a0-960f-2d0900d8cf93","resolution":{"observed_at":"2026-08-07T12:40:23.653922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.614748Z","title":null,"venue":null,"work_id":"cea3d5cd-1264-4e6d-8bda-14b9eaf95e56","year":2008},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.774847Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:2240a2d9206b23e01b16b6a0f8f740764a4edaaa9346e3f65e617cabef3137b8","observation_id":"38047f34-8511-4af7-a79c-3aa3e0647524","resolution":{"observed_at":"2026-08-07T12:40:27.665972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:23.909309Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.909309Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:036aec2de300958c85f0a84ce4c316a1150f5319fccffdaf886347b3fbf30ad3","observation_id":"78315454-865e-47d5-85c2-8a506a3bdceb","resolution":{"observed_at":"2026-08-07T12:40:23.909309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-07T12:40:24.048605Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.048605Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:fe018248213ba507aa2c8e2befdefbbf4557b4d5ddc756e969d18a3f5f0aa335","observation_id":"b02de5f7-6bdf-4022-bd79-3fc8e6f1fc5d","resolution":{"observed_at":"2026-08-07T12:40:24.048605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09121","last_updated":"2019-04-27T09:31:59Z","snapshot_observed_at":"2026-07-06T06:57:46.546190Z","submitted_at":"2018-08-28T05:16:35Z","title":"WiC: the Word-in-Context Dataset for Evaluating Context-Sensitive Meaning Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.09121","snapshot_observed_at":"2026-08-07T12:40:24.207704Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.207704Z"},"links":{"cited_paper":"/paper/1808.09121","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:31cf25c04c304b2561ca91cfc458ced9d928a3240b3c1eee89b3ffaa537ef55b","observation_id":"4bafe963-8524-44d5-8505-30bc59749d11","resolution":{"observed_at":"2026-08-07T12:40:24.207704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:24.416142Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.416142Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:f9ec657ddd60d1a62a370a5e8dc159cc4b7a47b9f3a15d6779b545508fca9dc1","observation_id":"65f43137-fc52-4c53-bd1e-8a217e64d890","resolution":{"observed_at":"2026-08-07T12:40:24.416142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-07T12:40:24.573184Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.573184Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:51341a489ec37ff305f7a68ca4203d0149af104a08bc5629e4758d06a4b110e4","observation_id":"54cbe89a-4503-4799-96db-12f820cdfc4e","resolution":{"observed_at":"2026-08-07T12:40:24.573184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00193","last_updated":"2023-05-18T04:44:51Z","snapshot_observed_at":"2026-08-11T00:14:31.064908Z","submitted_at":"2022-12-01T00:39:56Z","title":"Distilling Reasoning Capabilities into Smaller Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00193","snapshot_observed_at":"2026-08-07T12:40:24.689688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.689688Z"},"links":{"cited_paper":"/paper/2212.00193","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:9aa7c086dfb035c46b00b7000b08031d3db044f916c3079f258798561862ff0e","observation_id":"257dc47b-fe8a-44c9-a2f9-2b9ff886e6f3","resolution":{"observed_at":"2026-08-07T12:40:24.689688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T12:40:24.830152Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.830152Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:cd8fb25cfc0b05cc80a6313ebb19318a92a789cb2d0392df7dbb36687d52377f","observation_id":"a5c47a0b-e2c9-4d6b-8fec-911624b38379","resolution":{"observed_at":"2026-08-07T12:40:24.830152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:24.930772Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.930772Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:b10af902cb6542d18096e021db52798bbd5df01253bb525d2cf84e0d41dec7bb","observation_id":"00570187-611f-4a24-8219-5899ed7363f1","resolution":{"observed_at":"2026-08-07T12:40:24.930772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03975","last_updated":"2018-12-11T16:27:17Z","snapshot_observed_at":"2026-08-10T11:20:10.058598Z","submitted_at":"2016-12-12T23:54:52Z","title":"ConceptNet 5.5: An Open Multilingual Graph of General Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03975","snapshot_observed_at":"2026-08-07T12:40:25.039599Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.039599Z"},"links":{"cited_paper":"/paper/1612.03975","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c1f9156fedde00a8a0e740f597c2e4d419dec3e782f1a4557ffa0c3d33d19319","observation_id":"095d3917-8746-411d-af70-811b98c2edc7","resolution":{"observed_at":"2026-08-07T12:40:25.039599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-11T03:39:05.776539Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-07T12:40:25.116324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.116324Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c5cf375347ab6ae42274bff8baa1318ad5150640348a0cea7e8e9faa13467c82","observation_id":"12763add-803e-4d01-b0af-2d0cc0ac8fa8","resolution":{"observed_at":"2026-08-07T12:40:25.116324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-10T07:37:55.457401Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T12:40:25.216295Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.216295Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:51ce09b6491abb0490c4101f9dfc8ab39a1724438b91eb15cc17462f47fec9af","observation_id":"b27329ce-cb66-49f2-9255-abf8fc2f0679","resolution":{"observed_at":"2026-08-07T12:40:25.216295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:40:25.323189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.323189Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:d44ee65500a9af45d112c87bd5d67d8edf435e7b9a06a8e06d84384980f27b8b","observation_id":"2d2074c2-1477-4ada-9528-de233adf634f","resolution":{"observed_at":"2026-08-07T12:40:25.323189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-07T12:40:25.533618Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.533618Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:fb50b492628087cec77448c498e581d32f3c264bf489e2da4c1589a9fe5e5294","observation_id":"4dcbe3fe-33e6-4846-9bad-65b86dd06fa6","resolution":{"observed_at":"2026-08-07T12:40:25.533618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01562","last_updated":"2023-04-06T23:49:35Z","snapshot_observed_at":"2026-08-10T13:35:58.852957Z","submitted_at":"2022-11-03T02:55:54Z","title":"PINTO: Faithful Language Reasoning Using Prompt-Generated Rationales","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01562","snapshot_observed_at":"2026-08-07T12:40:25.631368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.631368Z"},"links":{"cited_paper":"/paper/2211.01562","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:74f56d336264c10a65de53e7eeb7b4ac7f834f7b2ddeea2a0550d71c0702aa2f","observation_id":"462cfb3a-0f95-4934-9d1a-ff179df4481a","resolution":{"observed_at":"2026-08-07T12:40:25.631368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T12:40:25.760065Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.760065Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:924a219df27ad428f7443feaa4b051eccfe691e0f6dc85f9566acf7370e14b4b","observation_id":"dcc9c0e4-4c24-4f64-a5d2-4dd864de52b9","resolution":{"observed_at":"2026-08-07T12:40:25.760065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T12:40:25.907355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.907355Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:17f4b61a3546eb1e4e3039f0c29f8f31f82ececc14e4c5c18c1214bbc95e64f2","observation_id":"7ecdca65-0108-400a-b15a-f9b1e5d7e4c8","resolution":{"observed_at":"2026-08-07T12:40:25.907355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03117","last_updated":"2023-05-22T05:20:04Z","snapshot_observed_at":"2026-08-10T11:18:52.764342Z","submitted_at":"2023-05-04T19:31:50Z","title":"Are Human Explanations Always Helpful? Towards Objective Evaluation of Human Natural Language Explanations","version":2},"cited_work":{"arxiv_id":"2305.03117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.03117","snapshot_observed_at":"2026-08-07T12:40:26.945839Z","title":"Are Human Explanations Always Helpful? Towards Objective Evaluation of Human Natural Language Explanations","venue":"cs.CL","work_id":"3c1c0be8-c662-4a57-9177-fb450c03b1f7","year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.997416Z"},"links":{"cited_paper":"/paper/2305.03117","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:00ae684ee99013c0214c8c0f7ee2b0a52db46185c14f7bbfbeb2e3f4f3b7bc64","observation_id":"40dd2405-2a69-490a-b677-efd1ac8a51fc","resolution":{"observed_at":"2026-08-07T12:40:27.015667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.067413Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.067413Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:467a279274764a33802943314ab8f8117850cd2ad8145d947e322ac42b7a119f","observation_id":"b536e245-d0fa-497e-adb3-06c316f44fdd","resolution":{"observed_at":"2026-08-07T12:40:26.067413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.195150Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.195150Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:570d669bf5b8fcd69fde4bbacd2c19c34b912bfdfd294094b1a39bebe13a5b66","observation_id":"6690da1f-68b7-4a73-892a-147b45a4e27e","resolution":{"observed_at":"2026-08-07T12:40:26.195150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.350229Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.350229Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:556a2d40d6f6f35b7687c0663040fc01548fddd52bd9a02d3429c93324c119af","observation_id":"d0dbb333-3f45-44e5-b7b9-b5790291ec42","resolution":{"observed_at":"2026-08-07T12:40:26.350229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01130","last_updated":"2019-04-01T22:21:14Z","snapshot_observed_at":"2026-08-10T07:57:27.021286Z","submitted_at":"2019-04-01T22:21:14Z","title":"PAWS: Paraphrase Adversaries from Word Scrambling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01130","snapshot_observed_at":"2026-08-07T12:40:26.482188Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.482188Z"},"links":{"cited_paper":"/paper/1904.01130","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:faa764fa8406cd04733171c5177a2290dcac80736a4734c4c3b1590047bed222","observation_id":"d0fb600b-51b0-4f95-a85a-c1f343441d17","resolution":{"observed_at":"2026-08-07T12:40:26.482188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.595287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.595287Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:1b353df26f1f828b15e566b14e9c04f94ec39bdf7dcb8a41423350448b3137d3","observation_id":"fab1b627-0bfa-4555-9478-4047dc0cb1a6","resolution":{"observed_at":"2026-08-07T12:40:26.595287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.667293Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.667293Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:65300d4056bf8e099adaad563d6e451341a55b136a8d1b4062d432ff8da77c5e","observation_id":"0be44cce-6a99-4ae4-8fb1-142526a1010d","resolution":{"observed_at":"2026-08-07T12:40:26.667293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.743983Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.743983Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:a92d5c05bf81bc5e989b81ac32356f5a7538d75b60b1222af84d40328f4a0634","observation_id":"d084c7b1-cc74-4273-b5d3-a193c4244004","resolution":{"observed_at":"2026-08-07T12:40:26.743983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T00:25:41.122128Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2505.24147."}