{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f666f13c3e0598f96ffff93708ac8793ccaf7e4fc36f4053c8650d4199e2536b","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:06:08.015456Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.23146/citation-record","integrity":"/paper/2507.23146/integrity","json":"/paper/2507.23146/citation-record.json","paper":"/paper/2507.23146"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1146/annurev-biodatasci-080917-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:09.179976Z","title":"Advances in Electronic Phenotyping: From Rule-Based Definitions to Machine Learning Models","venue":null,"work_id":"7ad9e11d-c2cb-47d3-9531-5771a8e86e14","year":2018},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.460274Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:04ff3f4a6b7640e38e1ba349dd6c42a22b09fe020fe67c937c5d76472d5aede4","observation_id":"d54002f8-0522-4c64-82c3-6fc6fa672aac","resolution":{"observed_at":"2026-08-06T11:06:09.261423Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s44342-024-00023-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Towards automated phenotype definition extraction using large language models","venue":"Genomics & Informatics","work_id":"11b64c0e-cf98-42e5-a39a-dedd45321cf6","year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.504790Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:c162e3e0280f26e1e5fe1b322cc26adeb3cb87324a3dffb5d5293858e5bf3157","observation_id":"5e62f23b-f03b-4b46-be2f-432198371a61","resolution":{"observed_at":"2026-08-06T11:06:09.037740Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.10329","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:09.675231Z","title":"Making work visible for electronic phenotype implementation: Lessons learned from the eMERGE network","venue":null,"work_id":"a6363b10-e1fa-4142-8875-85976abc8c50","year":2019},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.551733Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:ea2671015b63b491a123455158b6a18c6f4c14602040c99d4819f002975b8055","observation_id":"ecce1537-4bc9-4df4-a0ef-6e49733c6165","resolution":{"observed_at":"2026-08-06T11:06:09.737003Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/jamia/ocae121","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A general framework for developing computable clinical phenotype algorithms","venue":"Journal of the American Medical Informatics Association","work_id":"e4de1f05-f496-4b26-8256-f37e02d4dafe","year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.601759Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:830abde83473dd1a2e1b50e279eb8c40d35b79468328074b8cd243aee27649a8","observation_id":"60002c1c-ee0a-45fe-b3ce-cf618ee97445","resolution":{"observed_at":"2026-08-06T11:06:08.810249Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pdig.0001217","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"SHREC: A framework for advancing next-generation computational phenotyping with large language models","venue":"PLOS Digital Health","work_id":"a4df4cfa-6491-4e6f-8394-0e1163bc975d","year":2026},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.617860Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:0d1eb1b89fa3a6c1332516b3c976cbd466649526b6aeac35fe3e4967e998087a","observation_id":"3e8d64af-19ab-4855-86b7-148a74d8cde3","resolution":{"observed_at":"2026-08-06T11:06:08.636195Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35360","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:09.413546Z","title":"Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond","venue":null,"work_id":"1e534da2-b227-40cb-b037-e6995af27022","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.656771Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:8ac659117fe5796a543773f570e811bc3da3870845ed60a3eee28f2a0bae09a3","observation_id":"0a146695-c30c-4ffe-99bb-97119e4c1640","resolution":{"observed_at":"2026-08-06T11:06:09.489695Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.819362Z","title":"Deductive Verification of Chain-of- Thought Reasoning","venue":null,"work_id":"cf836ee4-d72c-4026-803d-c4798109b8f8","year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.701412Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:73a7c92cd8fc224c0f4eac24cf4e9abd048ec9d2d7e5639c42a71fa542706707","observation_id":"b616fc55-cd06-4d26-aa42-b5ff3b0a8acf","resolution":{"observed_at":"2026-08-06T11:06:11.822496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14825","last_updated":"2023-06-08T16:38:51Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:33:34Z","title":"Large Language Models are In-Context Semantic Reasoners rather than Symbolic Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14825","snapshot_observed_at":"2026-08-06T11:06:06.741394Z","title":"Large Language Models are In-Context Semantic Reasoners rather than Symbolic Reasoners [Internet]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.741394Z"},"links":{"cited_paper":"/paper/2305.14825","citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:52d382c319598542b08db4befb7e5afb5f0fbca5fec8331c4e4a01d3ae5e7f16","observation_id":"7d356364-cca8-44a5-952a-e662e2c37094","resolution":{"observed_at":"2026-08-06T11:06:06.741394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.810058Z","title":"Large language models can be easily distracted by irrelevant context","venue":null,"work_id":"f70c2b2c-90c6-4f9b-bbf8-2a35c7c85c01","year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.819302Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:3e9c9c3858a16e9f80010a5107f07a7c02487b73e39c267deab3f3d66adcbbce","observation_id":"abda25da-8ce7-42d6-8127-16a5f79c8862","resolution":{"observed_at":"2026-08-06T11:06:11.813349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.801212Z","title":"Testing the General Deductive Reasoning Capacity of Large Language Models Using OOD Examples","venue":null,"work_id":"53316900-5777-43f0-b4d3-cdbc2e4c2334","year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.857730Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:5be7a86e8275769cc32193f32426702411e3c60e44cf9f7adb46a08a4bdd935a","observation_id":"ecb8e2b1-4c21-4515-bfb6-8dfb8bea19a6","resolution":{"observed_at":"2026-08-06T11:06:11.804372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.791629Z","title":"Language Models Are Greedy Reasoners","venue":null,"work_id":"12d36d7c-8d39-446e-aab7-c728ea175e09","year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.899616Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:cd2197aa0e4657f136ba741582dbe8357091cf90586136a0e1d36575a3e9ae3d","observation_id":"b8782a17-710c-4bf8-9506-823e92a9e840","resolution":{"observed_at":"2026-08-06T11:06:11.794725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.782895Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":null,"work_id":"5ded0606-0d6b-4c47-978d-6a3fbbb99426","year":2022},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.916852Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:009955e5e040d09c1cccd9998475a77e63aabe1ac4c819b82bcec8b276070b2c","observation_id":"b8b0937b-036d-4321-8968-deee035c40ce","resolution":{"observed_at":"2026-08-06T11:06:11.785754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.774112Z","title":"Language Models Don’t Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting","venue":null,"work_id":"ee92864e-3906-47fb-a320-e9258362cccb","year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:06.960032Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:405dd31c3eb5c09e28f064c68308512fb26acc71cca9662471eb7d0b610ac4e1","observation_id":"5b9ef066-84a6-4d58-9623-7783d4479da1","resolution":{"observed_at":"2026-08-06T11:06:11.777191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.764587Z","title":"Chain-of- Thought Reasoning in the Wild is not Always Faithful","venue":null,"work_id":"184ebaf1-6490-48fd-ab04-b7f6b268a256","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.021933Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:b04ff5683aaed5acbeaa1a8aa165c7e3070dc4de8456cc649a5d274a6b602f37","observation_id":"3184707f-4722-46b9-90f4-3ff422920433","resolution":{"observed_at":"2026-08-06T11:06:11.767840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T11:06:07.060768Z","title":"Reasoning Models Don’t Always Say What They Think [Internet]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.060768Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:c3699117285416d399546211ac58ce70a821a5d790b4f122c21e5b531a2004cb","observation_id":"ef73b372-82cc-494e-bfc6-1fdb4ff1aad1","resolution":{"observed_at":"2026-08-06T11:06:07.060768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.755888Z","title":"[cited 2025 Jun 10]","venue":null,"work_id":"79e96c87-c83c-4914-ae8f-3156720a0b86","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.094504Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:111634c3ca6eb5010c30ee276ad1c6b2061735dbe50a5996d7642a7f01e48b73","observation_id":"7f52cf14-0354-4663-9143-5919abe82b67","resolution":{"observed_at":"2026-08-06T11:06:11.758678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05518","last_updated":"2025-06-26T19:29:49Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:41:42Z","title":"Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05518","snapshot_observed_at":"2026-08-06T11:06:07.155650Z","title":"Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought [Internet]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.155650Z"},"links":{"cited_paper":"/paper/2403.05518","citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:1e759e0e13387372543a1b24274e216bc511415a955f33e5c567bcd06659311d","observation_id":"024f890d-d398-4dd5-8c37-feb8dc44ad1d","resolution":{"observed_at":"2026-08-06T11:06:07.155650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.708720Z","title":"PHEONA: An Evaluation Framework for Large Language Model-based Approaches to Computational Phenotyping","venue":null,"work_id":"60615f63-0f81-41a9-83fe-83defcf7f2d2","year":2026},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.193010Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:fd2f76d75a282225b840ea59c67e6d5f61ae68a1f77e406959511cac82d0221e","observation_id":"f893180c-571f-442e-9f2e-92dc02c39bad","resolution":{"observed_at":"2026-08-06T11:06:11.749502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:07.220218Z","title":"Rule-Based Cohort Definitions for Acute Respiratory Failure: Electronic Phenotyping Algorithm","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.220218Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:ee50969d1f8b872cfbef8b8d056e652b2540334881443d16d4dc34b8af301beb","observation_id":"891c4f96-23b5-4df3-b540-349cd65ad081","resolution":{"observed_at":"2026-08-06T11:06:07.220218Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:07.263225Z","title":"The eICU Collaborative Research Database, a freely available multi-center database for critical care research","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.263225Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:f72874bf454a59ae53ba0aa9107939c1c58e162017444b4be828a85d00e564c9","observation_id":"123c2014-cb64-4304-b7a1-370b2f64a11e","resolution":{"observed_at":"2026-08-06T11:06:07.263225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.553622Z","title":"Ollama; 2024 [cited 2024 Dec 18]","venue":null,"work_id":"09498f3e-5bd7-45ea-8cb4-37e91dfd6dc7","year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.294351Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:f5a9c8822e21f487ec4c1f5c14bd7058a1c1f3b59b169917d75f1e5d773b988c","observation_id":"b02f6982-1d95-44ce-ac39-6fdde679ab57","resolution":{"observed_at":"2026-08-06T11:06:11.629792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T11:06:07.310546Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning [Internet]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.310546Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:7e0d4472a558765432036b1457e49c6784c62a628caaa1ec71020e464fe13b0b","observation_id":"7778794b-f615-4645-9215-924a56d0266a","resolution":{"observed_at":"2026-08-06T11:06:07.310546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.421592Z","title":"Interrater reliability: the kappa statistic","venue":null,"work_id":"34df91d1-626d-40f5-a3f1-53a98be58735","year":2012},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.354644Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:8400100521f5c675cc1935cdc4366dd1c7c94735b8ac63d2d283140799a16bb6","observation_id":"4d48fb61-40d5-4023-a5ab-870f5cdf9f9e","resolution":{"observed_at":"2026-08-06T11:06:11.476809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.277698Z","title":"Emergent Abilities of Large Language Models","venue":null,"work_id":"e4072eba-f0c8-4299-9379-1359b537d54b","year":2022},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.391617Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:1da7676bf6e79d5d289f7e02ee41bd85c15f0675f30b81ada8fac5611f4ceada","observation_id":"4bddb60d-a483-4e33-b631-11d2be39d3cb","resolution":{"observed_at":"2026-08-06T11:06:11.353567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-06T11:06:07.424864Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models [Internet]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.424864Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:74518d2804d5bcbd41ba7073edec8b55430530f6168b7ac3f06c2c32c1392fa2","observation_id":"da6d56fd-43bf-4ae9-b22c-afc316fc28a2","resolution":{"observed_at":"2026-08-06T11:06:07.424864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:11.096101Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":"ae78adcf-88ce-435b-a6d0-dda3c5f2255b","year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.465902Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:0f109a9d9fb97e5b4e8312e80f3c00aff8d92f264ac1e8ff51907ca497d33aa8","observation_id":"b5cbca71-b2bf-4625-ac33-4dee552f2ab7","resolution":{"observed_at":"2026-08-06T11:06:11.153034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.999911Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"b99f9241-bcff-4bd1-b53d-9fd0dd71a05d","year":2022},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.509894Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:66005aaf5f94b091ee3c9ccf2993e43e88f3d613f2479b5957473790858fea3f","observation_id":"69bb715c-ee4a-479f-acbe-59de0fd428f0","resolution":{"observed_at":"2026-08-06T11:06:11.061431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.893715Z","title":"Large Language Models Still Can’t Plan (A Benchmark for LLMs on Planning and Reasoning about Change)","venue":null,"work_id":"76581fc3-00dd-49ca-981b-15aa21742cf4","year":2022},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.536971Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:32f5202b2ff5a085e17b751a790c666bbd5d0186894498ecdfe599f6caa261d6","observation_id":"1056e776-a356-423a-997c-8a9764e62143","resolution":{"observed_at":"2026-08-06T11:06:10.960175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12397","last_updated":"2023-10-19T00:56:37Z","snapshot_observed_at":"2026-08-09T14:57:22.589761Z","submitted_at":"2023-10-19T00:56:37Z","title":"GPT-4 Doesn't Know It's Wrong: An Analysis of Iterative Prompting for Reasoning Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12397","snapshot_observed_at":"2026-08-06T11:06:07.559969Z","title":"GPT-4 Doesn’t Know It’s Wrong: An Analysis of Iterative Prompting for Reasoning Problems [Internet]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.559969Z"},"links":{"cited_paper":"/paper/2310.12397","citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:42618a9b505427980c80b7d9f623de98a2e5e21eb931942743cdd03c002f23f4","observation_id":"c2544d17-6930-4b8d-88d5-f83cfb1cdac9","resolution":{"observed_at":"2026-08-06T11:06:07.559969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2504.09037","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems [Internet]","venue":"ArXiv.org","work_id":"8fa11343-90de-400a-8208-dd3646b6987b","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.597872Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:d3b4a5fa52daae7da550bc7ef3a3c5042410f8875ef4dd297178741aa3ce5db5","observation_id":"888dab80-b151-4868-8594-17139b86394a","resolution":{"observed_at":"2026-08-06T11:06:08.423912Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:07.642134Z","title":"LLM-based agentic systems in medicine and healthcare","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.642134Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:7ab5d662337ec422b25e7dafe6c52585b545049aae5b0bd6557b685cb10e8936","observation_id":"fa68a6f3-8dcf-4edf-8fa5-97cb8720bf9d","resolution":{"observed_at":"2026-08-06T11:06:07.642134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.22165","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models [Internet]","venue":"arXiv (Cornell University)","work_id":"f896f145-b2c1-4b89-b9fc-e0cdf9e79d8b","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.686497Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:7d5ae25aa5b7f921357507a5256ca4a239927258b900ec7a85f27fab65d0bd1d","observation_id":"a3afde07-30b4-4c87-9655-91f2c8b96af5","resolution":{"observed_at":"2026-08-06T11:06:08.277622Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.748310Z","title":"Understanding Reasoning in Thinking Language Models via Steering Vectors","venue":null,"work_id":"f274c665-5379-475b-b597-c1310ea95360","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.751682Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:9927b6d20ab595bdc78e8235dbed6d11f3a63f53d2fbbeb57f224e2b5fbf2585","observation_id":"3edaae83-e511-42fa-9c1c-11e2599f7b9f","resolution":{"observed_at":"2026-08-06T11:06:10.802590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.617157Z","title":"Transformer Circuits [Internet]","venue":null,"work_id":"5a517b47-dae9-4e78-b3ea-ca5005f457eb","year":2025},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.768976Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:e1d7e3a310dd3b0bb352180f215a6d66627d587b3e2e37a3a1939b0f831d024c","observation_id":"4807b643-07c5-47b0-9b0d-a06a4faff031","resolution":{"observed_at":"2026-08-06T11:06:10.695705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.505250Z","title":"Unlocking the Capabilities of Thought: A Reasoning Boundary Framework to Quantify and Optimize Chain-of-Thought","venue":null,"work_id":"6822e416-e588-4f58-8040-18c1f08b10a0","year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.797726Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:35e627ac013aee457abe84e6bc74e773ca50f5a38adf80e73922e4ca211d2054","observation_id":"9914b539-2384-4531-91b6-7ef5e1c56318","resolution":{"observed_at":"2026-08-06T11:06:10.565561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.383188Z","title":"Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs","venue":null,"work_id":"466b5d17-1cfd-4c9b-86e8-5cdc7d32ca20","year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.837016Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:b685484395a76939f12d1a87fffba5d61d0d958b8f2ce943a09791a6a97ed433","observation_id":"fcfb08dd-3b77-4e4b-a4ce-7492b59e8e6f","resolution":{"observed_at":"2026-08-06T11:06:10.443518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3233/atde231203","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A Methodology for Generating and Optimizing Chain-of-Thought Based on Knowledge Graphs","venue":"Advances in transdisciplinary engineering","work_id":"c3987182-9f47-4b65-b87b-647448cd0e13","year":2024},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.858668Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:6788b493cf6cadabecddb7ba848ec420a5042d94b0204b66c7003005633cf5af","observation_id":"b1ab383c-93a7-4d8e-85fb-177e7e7fc905","resolution":{"observed_at":"2026-08-06T11:06:08.130096Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.252816Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"e087b0e2-6da8-487c-943c-f14ce6ab499d","year":2022},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.903626Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:b3c6708cd64b3917393e228b57a0beb6484d94dd916e74bad60f529fdc1d1051","observation_id":"ed20780e-9f5f-4627-ab4f-07f56ea36138","resolution":{"observed_at":"2026-08-06T11:06:10.322042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:10.081290Z","title":"STaR: Bootstrapping Reasoning With Reasoning","venue":null,"work_id":"9b7c0427-d780-4219-8a42-eaaf31d79bc4","year":2022},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.943266Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:ad8cb50735921fb4ec6075e4c14c494e47fed799f7e15b027c81a0c76c8f1471","observation_id":"5dbf6a72-a40e-4f07-bcc7-ac3a419b23c0","resolution":{"observed_at":"2026-08-06T11:06:10.189166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:09.916826Z","title":"Leap-of-thought: teaching pre-trained models to systematically reason over implicit knowledge","venue":null,"work_id":"39720b1e-15e7-41e4-8765-250e89435f42","year":2020},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:07.980640Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:96ad49a17ab7a3e4542acb8aab72110c70a2e6cef6a646a215ad4e5615fab45c","observation_id":"20faaa8f-1841-409f-b20a-4059bee80af7","resolution":{"observed_at":"2026-08-06T11:06:09.967053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:06:09.794679Z","title":"On contrastive learning for likelihood-free inference","venue":null,"work_id":"2ecf65d5-fe92-47ba-8fe3-b96562f7bfda","year":2020},"citing_paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:06:08.015456Z"},"links":{"citing_paper":"/paper/2507.23146"},"observation_digest":"sha256:2edb5f5467cebc0b390f9ba2be559541f0fa13a915d47a29951c6363e7325d90","observation_id":"136d5028-6b67-4198-b405-940d93b9e715","resolution":{"observed_at":"2026-08-06T11:06:09.853077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.23146","last_updated":"2026-07-22T18:38:53Z","latest_version":4,"primary_category":"q-bio.QM","snapshot_observed_at":"2026-08-06T11:06:05.284236Z","submitted_at":"2025-07-30T22:48:34Z","title":"Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":8,"verified_exact":6,"verified_fuzzy":23},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2507.23146."}