{"as_of":"2026-08-21T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d6aacc2506aa0d90b22c7674cb5d51248c6f37084c3da20ad13878d1bf34f72","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:38:32.919208Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08514/citation-record","integrity":"/paper/2608.08514/integrity","json":"/paper/2608.08514/citation-record.json","paper":"/paper/2608.08514"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.393603Z","title":"A theoretical study on bridging internal probability and self-consistency for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.393603Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:899d4de7e045431e991a6e3af7944be559ce18b9c303fae99339100b74e09165","observation_id":"c734432d-f798-4525-9d79-d7fa6670ba8d","resolution":{"observed_at":"2026-08-14T04:38:29.393603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.413712Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.413712Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:c4d668d30ad2e7a01d45248fc2f0d28c54675980c7efe54df719fc5eefeb116c","observation_id":"60eea3f7-4605-4e9f-850d-282b95192ac4","resolution":{"observed_at":"2026-08-14T04:38:29.413712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.425187Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.425187Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:317a68d86ac70232d33d78ed41310a9de86f709520a7fb291e88edd2e902ce18","observation_id":"e1f3b1a7-9164-4012-a834-2e53269f119c","resolution":{"observed_at":"2026-08-14T04:38:29.425187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.441490Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.441490Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:65c91b933d6033800863125a8d6e7206dd24bce369c2e06d2b2eab3ef9fd5b77","observation_id":"73a0b23e-842d-452d-b922-63aca2eb00f8","resolution":{"observed_at":"2026-08-14T04:38:29.441490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.474816Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.474816Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:65b7f5c72e8a253a6f575a58cc774355202562bb91ddec58d95e0c2446fc52a4","observation_id":"9efe772d-8935-459e-970e-1cd00f5ac2ea","resolution":{"observed_at":"2026-08-14T04:38:29.474816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.704746Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.704746Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:5b46c5b2f80d4c4a91ed07c51a62a440385b688816a2a984efd3a97c319214ba","observation_id":"57ca7b61-0371-4408-9269-eba455c1e80c","resolution":{"observed_at":"2026-08-14T04:38:29.704746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.735973Z","title":"International conference on learning representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.735973Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:7a92f2317443882c3c04d931b87bf13a566adcf6c4dd18d6a3ab6e31ff326193","observation_id":"88f81407-7851-45de-8cd4-568442bf7f49","resolution":{"observed_at":"2026-08-14T04:38:29.735973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.662003Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"5ae1acd5-ab2f-42e9-b99d-3a928007361c","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.742389Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:b4f769ec9112ae472e68679a9e616df1429681befd54393c8ae311f70760e820","observation_id":"1377a31f-370f-47fc-8d9c-81b0f5c433d3","resolution":{"observed_at":"2026-08-14T04:38:37.668189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.642061Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"3a670491-2bb7-49d3-9d90-d4dbd570870b","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.748966Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:9c95e70e1a3de7bb0da41cb303aa30e469bdf365a800c966a122721f83956e55","observation_id":"66e5729b-320b-403e-8848-2d810833fe75","resolution":{"observed_at":"2026-08-14T04:38:37.648440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.558913Z","title":"Findings of the Association for Computational Linguistics: NAACL 2024 , pages=","venue":null,"work_id":"180290ad-e7a1-4ca7-b685-8a80128549e7","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.753800Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:5e83ed1d90d974ecfe330578482f98dfd6921a7b9729a9dd5a7c42105b502b3e","observation_id":"c2a31f81-c932-44a8-b2fe-fd4fb8e726f7","resolution":{"observed_at":"2026-08-14T04:38:37.592787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.510026Z","title":"Proceedings of the 2024 conference of the north American chapter of the association for computational linguistics: human language technologies (volume 1: long papers) , pages=","venue":null,"work_id":"ec09d4f5-d6bd-4081-969d-0e54713b3a5e","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.762127Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:a1e0382ca79bd9bc7c5b6fdb2e3a5423acb3a7e8c3f26cf439b71a9b2c8bccfd","observation_id":"0063fffd-0a65-4454-b87b-aa805cffcfda","resolution":{"observed_at":"2026-08-14T04:38:37.527859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.481561Z","title":"Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":"e915382b-6116-49a0-bcae-284ef372508f","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.853199Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:4ff995a3a24753567bd47807349150f10085cb09dc6570b3c952cfc672840082","observation_id":"672b4d9d-8e21-46b4-94f0-5620720e4557","resolution":{"observed_at":"2026-08-14T04:38:37.488454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.364751Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"fd86070a-2c54-4fde-b6fb-d22b6b64027a","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.866009Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:8e2eab7751b2c01de97a47bbfac74a35263ae4789aa2f874f96f9e0d27e3f7cb","observation_id":"bfacadbe-304a-4730-b6cd-82fae0697c78","resolution":{"observed_at":"2026-08-14T04:38:37.462237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:29.900917Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:29.900917Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:d23c6a6e8a7ebb45002aaef40a01d89bc90becb01680503ce94557759083d423","observation_id":"1219e185-b70f-4114-b208-cb72e12654ed","resolution":{"observed_at":"2026-08-14T04:38:29.900917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.207153Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"d4370368-f0c1-45cf-811d-da515b6761a5","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.138795Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:0d96493a5a9b867442abefd2a5b9fda5ea6ae77c5488c66f17f7aff70534bc5f","observation_id":"3889da67-a349-4994-9a4d-7e34a4bccceb","resolution":{"observed_at":"2026-08-14T04:38:37.268884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.166969Z","title":"ACM transactions on information systems , volume=","venue":null,"work_id":"a4385b32-ce1a-4867-944e-fce79b637ca5","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.157972Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:6bcd7190cfee391357fc258510ddff1cd26f46538ff78a0f19e65a2103f891b1","observation_id":"624058df-f0fe-427b-84ad-eca76cbd53e9","resolution":{"observed_at":"2026-08-14T04:38:37.171869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.148873Z","title":"Editing models with task arithmetic , booktitle =","venue":null,"work_id":"6bb2f890-c2d5-4ceb-adcb-c73a669bbab7","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.163668Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:aa3ed7e89edc84052c8a4f0278576afc40d23e38f15b01056c7245d20391b601","observation_id":"a8490bb4-5015-4d24-8321-6e4aca928086","resolution":{"observed_at":"2026-08-14T04:38:37.154843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:37.129085Z","title":null,"venue":null,"work_id":"3fc3a549-de90-46ff-891b-0299b5624065","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.280569Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:8b3650d3bb4a4c0c2857902f759adbab514463af831225f20f4e684bfc1183a8","observation_id":"732b2403-5793-440a-a7dc-119d64058fa9","resolution":{"observed_at":"2026-08-14T04:38:37.134504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.317844Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.317844Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:29f2878c572db3d70e8302a2bbf2dd58beb8ce17a0d541543318c3b463099614","observation_id":"9bd9ec5b-4b16-4629-867c-602bea910084","resolution":{"observed_at":"2026-08-14T04:38:30.317844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.343347Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.343347Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:a1aeb7d98c6648f12cc9e037cf13857031233a4e9d0569ba58a343d2da4efbaa","observation_id":"052c7001-443e-401b-ad91-e5076f46b0a2","resolution":{"observed_at":"2026-08-14T04:38:30.343347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.355500Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.355500Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:b2621246a9964546596fcb18064db55f6931ea9648cf58265b87358bb0784a93","observation_id":"da7334de-ba17-4f80-a124-a78db7344676","resolution":{"observed_at":"2026-08-14T04:38:30.355500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.360223Z","title":"See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.360223Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:9b0e9b74b03b5941f819d26179e49943f6a8b8a4395c52a7e7bcf7269a089e46","observation_id":"82649786-9b6d-488e-b400-da4ec2d90616","resolution":{"observed_at":"2026-08-14T04:38:30.360223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.365137Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.365137Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:409d807d4ab40ac7bec9931c8c2a18b3684b65ff18e81bd12d1cf4628b993609","observation_id":"6c841378-3db5-4a1d-b91d-91372d7bf795","resolution":{"observed_at":"2026-08-14T04:38:30.365137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.386560Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.386560Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:1b3d789d5be5962fcd86c6d78693bafe6d134c420128cc085a9f431e4922b57b","observation_id":"42b17ef1-c9e1-4ebe-8096-a250016d1c41","resolution":{"observed_at":"2026-08-14T04:38:30.386560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.437146Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.437146Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:4090c4c3882e64d2c9d99a2cdf0bef051a561ac9f53fe5ff8081e574a4389a40","observation_id":"af641391-fe25-4a24-ba4f-8acc1598c3e6","resolution":{"observed_at":"2026-08-14T04:38:30.437146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.494075Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.494075Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:5494ba6e1d02533911a24c67e06fc3880fb77addfddfc9833d7aaab8e5b19dbd","observation_id":"0f09f3f4-9a45-4f78-85f2-1b9f5dae6296","resolution":{"observed_at":"2026-08-14T04:38:30.494075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.914557Z","title":"Decodingtrust: A comprehensive assessment of trustworthiness in","venue":null,"work_id":"1cd234b4-4dce-431e-914f-591cdfdc74ee","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.600199Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:710107ca16ac48af756b0098a97fd7beb62e55ca905a6392e6d8980f56d96de2","observation_id":"1272a8cf-b4c7-44f1-8a5d-29e315c19d21","resolution":{"observed_at":"2026-08-14T04:38:36.965377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.625712Z","title":"Measuring mathematical problem solving with the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.625712Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:2a128f863b24fe6ac2c1ffa41011f59ac0df97cbbf46b063df7132c6163e498b","observation_id":"46cf63b6-40ea-4950-bec2-22a798fa3c57","resolution":{"observed_at":"2026-08-14T04:38:30.625712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.834931Z","title":"Scientific data , volume=","venue":null,"work_id":"e65e0b7b-f238-4faa-9ca4-b02347fc1971","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.703886Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:2a78b4fcc9d2adf87d10967ba2cf9ab1a7e5c16544ae7831a7898fbadfbee53f","observation_id":"2cbd2b1f-17a2-40fe-8888-d8eb5a338178","resolution":{"observed_at":"2026-08-14T04:38:36.840505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.811413Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , year =","venue":null,"work_id":"9e60c75c-7f65-48b3-b20c-1e455395c108","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.733991Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:aaaeb806ba3357c676ab63d7f6b7efebbc1bfe4cba80c3fbc324239d14390a43","observation_id":"c48aa57a-d5d3-4b41-98ff-39233ae95160","resolution":{"observed_at":"2026-08-14T04:38:36.816251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.734845Z","title":"Bowman and Kyunghyun Cho , title =","venue":null,"work_id":"e7847d59-43c9-4904-85d5-72ed717e8c8d","year":null},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.909323Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:021a7d4ff283bfb0df19cef9606b3f813642f065a381f04ab0918dd8082188d6","observation_id":"dd80409c-8bf6-4270-a241-020efdf7acbd","resolution":{"observed_at":"2026-08-14T04:38:36.792435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:30.945035Z","title":"Nature , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.945035Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:dd37e22aa0f1e3ce118876da3b4f0a89bf1ff360af29603596054cae2a47fff1","observation_id":"7c24ad48-62ed-4863-a4c6-a1166cc42114","resolution":{"observed_at":"2026-08-14T04:38:30.945035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.609245Z","title":"and Dasgupta, Ishita and Chan, Stephanie C","venue":null,"work_id":"19a521c4-8f7e-476b-8040-0d7079040ced","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.955284Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:8ad808b3be3e295417a1d2ef913d2819ddcc4f648903565df6d7870fe0acd5ea","observation_id":"817617db-87a9-46d5-b247-27ba3e05b2c3","resolution":{"observed_at":"2026-08-14T04:38:36.649737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.570559Z","title":"A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions , journal =","venue":null,"work_id":"89862e65-4d4a-4803-b05a-180e1442548f","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.960760Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f9e02693e97e8e789f70d65de2e56af9ed75e442bc273261b2372ce6a7e5eb89","observation_id":"e53ea659-c6a7-41df-ab8f-e37067c7b935","resolution":{"observed_at":"2026-08-14T04:38:36.575424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.554817Z","title":"Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference , booktitle =","venue":null,"work_id":"1baeb1f4-149e-4c35-b9aa-b17749db9a5d","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:30.974164Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:3a05ebe9e5f02f139cb1188cab1ebe2d3fba30e417dfaede794c4564b1d58d6b","observation_id":"46e20523-2707-4de4-9883-96a299688970","resolution":{"observed_at":"2026-08-14T04:38:36.560227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.539911Z","title":"CoRR , volume =","venue":null,"work_id":"1cbf4872-555e-49d3-a773-d6b518c3bad4","year":2026},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.012837Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:0cba8e4f0773b1bf4bed8a43dd42cf3f65343f9059e4380bd13ecabe3f58f012","observation_id":"fb9869c7-dd9a-4da1-9277-217f53c5ca3e","resolution":{"observed_at":"2026-08-14T04:38:36.544790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.523818Z","title":"CoRR , volume =","venue":null,"work_id":"56dea717-d340-44be-9fb3-4233bc4c8987","year":2026},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.116821Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:a2428b3be5d33e8fd03bbf07da7bdaffc5c8fd84fd919ede39bca193dd2c9cae","observation_id":"b13a4848-5500-41f1-904d-9de18a788ea6","resolution":{"observed_at":"2026-08-14T04:38:36.529081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.492896Z","title":"2025 , eprint =","venue":null,"work_id":"f4b8784d-569b-4fbe-8ec2-d54d5117989d","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.184753Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:923ac45855877c1e50e85df1a9190377bd1dc60392eaa913db4e9d85cc1e0fa9","observation_id":"6d243b2c-69f7-4a06-8092-ed0adc1c2e28","resolution":{"observed_at":"2026-08-14T04:38:36.503976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06700","last_updated":"2026-04-20T07:21:01Z","snapshot_observed_at":"2026-08-08T23:50:21.318927Z","submitted_at":"2025-10-08T06:48:08Z","title":"How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects","version":3},"cited_work":{"arxiv_id":"2510.06700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06700","snapshot_observed_at":"2026-08-14T04:38:33.941375Z","title":"How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects","venue":"cs.CL","work_id":"e3470ba3-92ec-461f-a42e-83b4b75aab77","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.201358Z"},"links":{"cited_paper":"/paper/2510.06700","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:3c2262c62480a41f8e741e8df62eb667bcd96ea49f4e5d427a426e67531ccaaf","observation_id":"419f56d2-66c3-40a9-983b-df74ebe79302","resolution":{"observed_at":"2026-08-14T04:38:33.986134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.365123Z","title":"Bowman, and Kyunghyun Cho","venue":null,"work_id":"5cf14f17-b4c2-4069-89d1-9b131d183d84","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.225005Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:fbfdc7955786094d3b1644c1c082127651d763545330c38851431fcc2d3ca87d","observation_id":"2f4b02b7-fcb8-48b9-9b9f-0e33f5c75d8e","resolution":{"observed_at":"2026-08-14T04:38:36.443512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.291093Z","title":null,"venue":null,"work_id":"eff259ce-621b-46b7-bae6-055b3f0f3016","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.306392Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:a8d3c82b462b084a7cbafbd9e1c31559b870fdcf36e2a7e0fe30ec794ea1cdf8","observation_id":"2b83246e-b34b-4ce2-990e-7f6d6e6fa822","resolution":{"observed_at":"2026-08-14T04:38:36.295824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.275575Z","title":null,"venue":null,"work_id":"a21b269d-a452-44b6-9f56-f97da390e294","year":2026},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.400415Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:670fb6a491b7553c13bc768351bc33f87f6168811cd0cd60b85adc8c5f2019ca","observation_id":"1a53c7e3-e521-4d45-8a5f-31540892d724","resolution":{"observed_at":"2026-08-14T04:38:36.280571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-14T04:38:31.444848Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.444848Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:178f8f6db65e958b12bdda248c728ce8f5051d859459a6b5e935f32bd4d0df8c","observation_id":"d49d046a-b5bc-4d01-8a56-4ad026542ef5","resolution":{"observed_at":"2026-08-14T04:38:31.444848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07051","last_updated":"2024-07-17T22:01:29Z","snapshot_observed_at":"2026-08-16T16:45:54.887784Z","submitted_at":"2022-07-14T16:51:09Z","title":"Language models show human-like content effects on reasoning tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07051","snapshot_observed_at":"2026-08-14T04:38:31.464173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.464173Z"},"links":{"cited_paper":"/paper/2207.07051","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:a63c5e1b9868bd55da2c6887f948200e0af67f9369a330abd041077329712aa4","observation_id":"2696838e-955d-4f48-8d98-f7f79a45c11b","resolution":{"observed_at":"2026-08-14T04:38:31.464173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.230729Z","title":null,"venue":null,"work_id":"2e57e829-e1f9-4ca8-807f-794ef6c8cd65","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.477456Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:31c53fa026980d09f4ab737de50c3fb022293a4d12dc1e27159e05c7db98880d","observation_id":"13644665-fcd0-4456-afdc-80bb690da53d","resolution":{"observed_at":"2026-08-14T04:38:36.235734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:31.577327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.577327Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:b36b16ae15a482f3d28d466cf7ee6707f55e296456d6eb4510b5eebbe777dcd4","observation_id":"8c8bddd4-1565-4cf5-b484-61d69c042639","resolution":{"observed_at":"2026-08-14T04:38:31.577327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.091832Z","title":null,"venue":null,"work_id":"a7f81f93-6441-4e0f-ba75-94cea2d1fdee","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.644659Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:d8847fcbdfd3ef6f514a3dc19305bf217a14646ebebf0b8b21df36056ef11bc5","observation_id":"7e1e5059-c760-45cb-a1d6-d070147edbca","resolution":{"observed_at":"2026-08-14T04:38:36.180639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:31.671152Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.671152Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:4fc285f167dae2b36445d91e532e166cd8114110094f16aa6af2366f3d332b33","observation_id":"73bbedaf-aff3-4824-958d-62d09401efe6","resolution":{"observed_at":"2026-08-14T04:38:31.671152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:31.681271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.681271Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:facf14bf575f87b91be7de01ef8b174f2b59698ea54e84ae7acdd03481e6e04b","observation_id":"ae8709b9-5e4f-4a55-a5b3-25623ebe935d","resolution":{"observed_at":"2026-08-14T04:38:31.681271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:31.691855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.691855Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:e73ce6ed925c0101037aa30bee05c917687f59460a7990bd3264e4bbfdf5b909","observation_id":"9de45a6f-e258-4b83-bbb4-d8071ebf80cc","resolution":{"observed_at":"2026-08-14T04:38:31.691855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:36.001584Z","title":null,"venue":null,"work_id":"e75f0b1b-6027-4d22-9b02-66a6dede9985","year":2021},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.735255Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:64f89314782b00e12a9a51d95ba79b998ef2e1b08d0cc2db2f85e1d113604108","observation_id":"29bcc972-c6a6-4f3a-9d10-196f8f1f3403","resolution":{"observed_at":"2026-08-14T04:38:36.018463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.924343Z","title":null,"venue":null,"work_id":"39109436-ad62-4d99-8aea-8b673bd2e3b7","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.858739Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:2cbae570c4d1ea839e750086bf812321073a801066d5897e1c76602cb363a337","observation_id":"18d3a811-828d-4d84-87e4-123eb4d0b438","resolution":{"observed_at":"2026-08-14T04:38:35.944022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.883635Z","title":null,"venue":null,"work_id":"8293312c-50cf-4e48-851e-6cae5ad84444","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.944117Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:bf7f285e4f1d7b493f7d0c6317f64bfe05950c168a9f3324110caf20e527caa2","observation_id":"709590ad-6370-481a-a663-251ad2cd52a3","resolution":{"observed_at":"2026-08-14T04:38:35.889585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.789892Z","title":null,"venue":null,"work_id":"a81ba811-7146-4db9-9eb5-5aeb47f13c5d","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:31.994751Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f9d0e2f51f59af3f31cfab1852525a3e34929ef0d368dcbaea0068b3f21220c5","observation_id":"0e1d7c5c-a518-4588-84b9-23798b2eab1b","resolution":{"observed_at":"2026-08-14T04:38:35.825790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.027401Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.027401Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:b13eec2c830ff9365a30822ac5da0cb676e8db6bdf39c6290e1aa7b0d8d8fae6","observation_id":"2417c61b-f0e3-479e-a674-cc7d9db96523","resolution":{"observed_at":"2026-08-14T04:38:32.027401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-14T04:38:32.051073Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.051073Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:085a2ed63344900c42c7470ca62fafb537dbfa7e6fecc1c9a1b247e4808a7d2f","observation_id":"3dc43e5d-bfb3-452b-acb9-7ee0ad3e7132","resolution":{"observed_at":"2026-08-14T04:38:32.051073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-14T04:38:32.072674Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.072674Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:2a63eae17473f19dd9afac74a64646a0b091def65cfba7b79adc7b0d988a646c","observation_id":"5c233d67-9e3e-42d1-a788-9db6415a7453","resolution":{"observed_at":"2026-08-14T04:38:32.072674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08590","last_updated":"2025-06-21T10:50:24Z","snapshot_observed_at":"2026-08-18T21:09:47.215005Z","submitted_at":"2024-08-16T07:47:39Z","title":"Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08590","snapshot_observed_at":"2026-08-14T04:38:32.133626Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.133626Z"},"links":{"cited_paper":"/paper/2408.08590","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:14efbbd36c8257ffa11afc485f38e1ff06654a50a8b3f99cc9d7b4ed20f5e02b","observation_id":"a423860e-33ad-4e7e-979e-8e2a207aef9a","resolution":{"observed_at":"2026-08-14T04:38:32.133626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.13735","last_updated":"2026-06-03T09:26:48Z","snapshot_observed_at":"2026-08-18T19:04:54.726158Z","submitted_at":"2026-01-20T08:46:33Z","title":"Reasoning or Fluency? Dissecting Probabilistic Confidence in Best-of-N Selection","version":2},"cited_work":{"arxiv_id":"2601.13735","doi":"10.48550/arxiv.2601.13735","metadata_source":"pith","pith_arxiv_id":"2601.13735","snapshot_observed_at":"2026-08-14T06:16:15.895014Z","title":"Reasoning or Fluency? Dissecting Probabilistic Confidence in Best-of-N Selection","venue":"cs.AI","work_id":"26f8312e-fd3e-4143-9027-c241f31663d6","year":2026},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.269935Z"},"links":{"cited_paper":"/paper/2601.13735","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:61fdabd82f9708392b3216416b3dad0a97a49ab8b5931c4491bbf7d57158162c","observation_id":"06450b15-ec85-4e10-bb5b-cfc1138584e7","resolution":{"observed_at":"2026-08-14T04:38:33.518993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.330099Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.330099Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:4ae09d772488aad0dabdb98dfcb644e3be91fe4033b6042188a3bf0b659b34a8","observation_id":"2e681953-69d4-4851-8126-a1631c27b2f1","resolution":{"observed_at":"2026-08-14T04:38:32.330099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.343158Z","title":"Lampinen, Ishita Dasgupta, Stephanie C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.343158Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:edb9dca2f8f1984c5aa322b673028f9a863022aef49ebda37f905e1dd8a33061","observation_id":"e31ac90c-3ac5-4444-948f-754189f50879","resolution":{"observed_at":"2026-08-14T04:38:32.343158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.347682Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.347682Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f3bc7f1c9ad34a34cf4c0493d7b183277cd9f565da8ebb12d0ff32e2f4dba7a0","observation_id":"244e6e94-a9ed-4caa-afbd-024049176e50","resolution":{"observed_at":"2026-08-14T04:38:32.347682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.667027Z","title":null,"venue":null,"work_id":"aa414919-1e09-47c8-b935-169250a3b0be","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.357333Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:3043330b73fd2d46b58d1e63b21e18d0e6091ef8374516d784cf325abe918d28","observation_id":"e5e0488c-4539-4377-9428-bcc5d50653bd","resolution":{"observed_at":"2026-08-14T04:38:35.671791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.605184Z","title":null,"venue":null,"work_id":"a94bda37-96e2-49f7-8bd4-0a52cd74a4e9","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.366200Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:020d464ad27cc28497b3015cac05b9b9806195dc782df9fc7b28b628c01113c4","observation_id":"420cc076-7a59-499a-b220-1662578e5aa1","resolution":{"observed_at":"2026-08-14T04:38:35.627147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.504960Z","title":null,"venue":null,"work_id":"dab5e540-7b8b-4297-8afd-1a295fe18ab3","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.384752Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:bbe76a11cc0618b5febe1401413501bf10184d477d7d3f9f8f022f7f40437b6c","observation_id":"02422e97-4064-482e-8162-ff34073cb61c","resolution":{"observed_at":"2026-08-14T04:38:35.556499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.502874Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.502874Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:cd05ffac94a8b6ee67b54cb4c889c577e90c9810ce65b0c8a33697e949b81b30","observation_id":"128b6240-e075-496e-a23e-78d7d9991da2","resolution":{"observed_at":"2026-08-14T04:38:32.502874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.567621Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.567621Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:040dec0bfba0c40772453ac10b72a41e9ad605fd4a25c3bc2543e47b3cbc0e64","observation_id":"3c15675a-aee9-4556-88d9-62e9c5d1f7ed","resolution":{"observed_at":"2026-08-14T04:38:32.567621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05715","last_updated":"2026-05-07T05:58:38Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:58:38Z","title":"Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes","version":1},"cited_work":{"arxiv_id":"2605.05715","doi":"10.48550/arxiv.2605.05715","metadata_source":"pith","pith_arxiv_id":"2605.05715","snapshot_observed_at":"2026-08-14T06:16:15.895014Z","title":"Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes","venue":"cs.AI","work_id":"b2d773f0-269b-457e-8b03-f97114ed52a1","year":2026},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.607555Z"},"links":{"cited_paper":"/paper/2605.05715","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:b0152113c40d1fc42b4add90375c0ad6b84bdb84a2b45746bdf9398d826b62d2","observation_id":"cec8fb98-3329-4271-bf3c-53a322504d2a","resolution":{"observed_at":"2026-08-14T04:38:33.225380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-14T04:38:32.636912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.636912Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f5cc22d7384ec65f6f93bd642fa3a0098cad923c9a26eb096c8b5a05eb1aa80f","observation_id":"f0c6f1ff-5e16-4e2e-acd0-86b3c598d83d","resolution":{"observed_at":"2026-08-14T04:38:32.636912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.223185Z","title":null,"venue":null,"work_id":"77ac93e4-aa78-420e-87ea-a711ccb3f5d7","year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.664526Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:5a76822089020f5bef178a560b35c6b16b8222989b5388a589faec648408b278","observation_id":"28cebaca-5bab-40d3-bc7c-8b496124eb82","resolution":{"observed_at":"2026-08-14T04:38:35.275315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.165192Z","title":null,"venue":null,"work_id":"7eef5c75-54ae-4dbd-8b04-631568b4d226","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.675625Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:5decaff65c7a48b581f32dcc1103a07396878497585c2d7c04849dcdbd5f2638","observation_id":"648b2861-71a3-40d1-ace1-763165b75047","resolution":{"observed_at":"2026-08-14T04:38:35.184832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:35.050743Z","title":null,"venue":null,"work_id":"236f5a49-7848-4aaf-868e-968c913e304d","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.682371Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f26360d903f6a373f3150c296ccdd5800fe27c45148b61988d2e9c3fa33846cb","observation_id":"ecf54294-e05f-4e54-b85b-00f5aecf3017","resolution":{"observed_at":"2026-08-14T04:38:35.113679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-14T04:38:32.689968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.689968Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:c7573310fee99567f132fa9b7cbc826f4e78e2391703b2b7c8c78fcdc54b42da","observation_id":"4fcaf7e7-116a-48b3-9d2e-ad61251ab37d","resolution":{"observed_at":"2026-08-14T04:38:32.689968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-14T04:38:32.696643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.696643Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:ed024e72f7ecb6abe88eae2cc4434e56985b50a590f3d19c046d4c4d5d95e651","observation_id":"3b7ab6a0-5062-4ed2-b58e-2fbcacf7c3c5","resolution":{"observed_at":"2026-08-14T04:38:32.696643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:34.905297Z","title":null,"venue":null,"work_id":"5ddbe64d-1c72-4e42-a183-087f39ee45b0","year":2026},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.703357Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:1c4dd64156645eca1507bdc4781e4c79455e8b93cd7f2c3b62a53ba09cf825c1","observation_id":"1492d38b-3887-4bc8-9618-22c6699ec807","resolution":{"observed_at":"2026-08-14T04:38:34.929810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20303","last_updated":"2024-09-30T14:00:34Z","snapshot_observed_at":"2026-08-16T13:14:07.866644Z","submitted_at":"2024-09-30T14:00:34Z","title":"A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20303","snapshot_observed_at":"2026-08-14T04:38:32.730399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.730399Z"},"links":{"cited_paper":"/paper/2409.20303","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:df6f7082dbafc092c77530a50f5ace1ec2561c4ff82e2b4a89963643c5ed7d6d","observation_id":"63faa26d-508d-4bd6-9986-e8d64ae9d059","resolution":{"observed_at":"2026-08-14T04:38:32.730399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:34.819420Z","title":null,"venue":null,"work_id":"a86aad69-adba-4753-82d3-a07f933fd8ed","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.738393Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:674ea26c98a5c1435c40f4075cbc1c49538a6178009a8dc3c7fe40f87bc00198","observation_id":"e39b0f66-5fc6-40e3-9335-9f8d55a16d40","resolution":{"observed_at":"2026-08-14T04:38:34.855908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07521","last_updated":"2023-12-16T12:47:19Z","snapshot_observed_at":"2026-08-18T10:45:30.869066Z","submitted_at":"2023-10-11T14:18:03Z","title":"Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07521","snapshot_observed_at":"2026-08-14T04:38:32.744053Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.744053Z"},"links":{"cited_paper":"/paper/2310.07521","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f59f086f1a79a69073f9866eda485b2db919ef1fced19dd6467de3217df9c7fe","observation_id":"7fe996ed-9fb4-40a2-ab80-dc21d5c04970","resolution":{"observed_at":"2026-08-14T04:38:32.744053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:34.624164Z","title":null,"venue":null,"work_id":"1f7428e1-d843-43b1-9cf8-0fcc40508f24","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.748786Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:8069e56683c937bd55350f9e42a6e53f87ca2b8ba6d13c4ea23a6bdef711e0db","observation_id":"9072a35f-1325-4f40-99b4-b1c204d3bde7","resolution":{"observed_at":"2026-08-14T04:38:34.732289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.753527Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.753527Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f2a22e68f506cc10029e7a445434f508f016730fb34207606e7aa699d2d0e51c","observation_id":"9ca1744d-069c-49a4-a5be-30b82bed0347","resolution":{"observed_at":"2026-08-14T04:38:32.753527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:34.480628Z","title":null,"venue":null,"work_id":"4b8928ca-07d0-42bf-b1b8-b8c9aed898d9","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.767317Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:c699d31d4f8607f2ece95503869980871231c1c0c09d476cbc57308104db1f12","observation_id":"1f1c5da7-a82d-4b27-ba2e-acabb39ed9a0","resolution":{"observed_at":"2026-08-14T04:38:34.534755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:34.379116Z","title":null,"venue":null,"work_id":"9c923e97-2792-4087-a8f1-ea4b9e62d477","year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.772100Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:f9b4ee537e4838de4ebcb7e221106450339470ecf3082aacf93577dadfe3cd76","observation_id":"907080f4-c786-40a8-b30f-698a19c02652","resolution":{"observed_at":"2026-08-14T04:38:34.439030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:32.809582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.809582Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:4336e53eb294177007799ff1d903050a0ff584ff185e262465880dfe81232ea5","observation_id":"116c2d3a-300e-4f3b-ac50-d815ce390565","resolution":{"observed_at":"2026-08-14T04:38:32.809582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:38:34.318718Z","title":null,"venue":null,"work_id":"d3dcc573-0663-4118-abdc-69ba81e290e6","year":2025},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.855233Z"},"links":{"citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:6a19db2c894b98a56c3e787aa16bfda4959c348827aee27a111ee06b51eb7273","observation_id":"217820bc-4d53-4456-beaa-17067bde0438","resolution":{"observed_at":"2026-08-14T04:38:34.324606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-14T04:38:32.919208Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-14T04:38:32.919208Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2608.08514"},"observation_digest":"sha256:afc281f5fc8ccfbdfb71cd7ed02f717a2830b3ee650648496cbcf313125d540c","observation_id":"802b8c12-7e68-4d05-a3c8-1755677a6618","resolution":{"observed_at":"2026-08-14T04:38:32.919208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08514","last_updated":"2026-08-09T06:22:02Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T01:35:39.771334Z","submitted_at":"2026-08-09T06:22:02Z","title":"Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":3,"verified_fuzzy":20},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2608.08514."}