{"as_of":"2026-08-16T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20e02a66a7ae24bf6a3036bdac8296b57e040f84064ffc664d4adaa9171ba14c","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:18:11.112009Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07813/citation-record","integrity":"/paper/2608.07813/integrity","json":"/paper/2608.07813/citation-record.json","paper":"/paper/2608.07813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-11T04:18:11.048811Z","title":"Qihao Liu, Luoxin Ye, Wufei Ma, Yu-Cheng Chou, and Alan Yuille","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.048811Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:f1cc8418015d91be7c14b753c89a67152b61848fc3443fd399e89511079c6809","observation_id":"cfb53ac5-7f8d-4fd9-bf39-5e8b2690071c","resolution":{"observed_at":"2026-08-11T04:18:11.048811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:11.380066Z","title":"Factscore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"e766ef40-efc8-4482-9bf3-4a97122084de","year":2023},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.059931Z"},"links":{"citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:341100ab2d40394745a3872402c49fc2ce6370c6227ce623c9b476e85841ea11","observation_id":"32bcac5d-3cb4-4e06-86ba-4e576eae9dcb","resolution":{"observed_at":"2026-08-11T04:18:11.385320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:11.065092Z","title":"doi: 10.18653/v1/2023.emnlp-main.741","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.065092Z"},"links":{"citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:294940be4e0e3164e26c45818324a1e4a20d746664ccc9240d1219734d171d4a","observation_id":"fdf26fe2-76bc-4506-95a7-fb8b3621f7d1","resolution":{"observed_at":"2026-08-11T04:18:11.065092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-11T04:18:11.070300Z","title":"Long Ouyang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.070300Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:ecd2e0e741e3a412191f89576da29b315c51f29437e185dac8bd7814e1d546c6","observation_id":"5ead05c0-3feb-4beb-8912-c0bcb3e264be","resolution":{"observed_at":"2026-08-11T04:18:11.070300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-15T16:38:26.345282Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-11T04:18:11.076461Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.076461Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:0ab27eddee7ca5ce5a886692e4e474496c5993b73cfe31592db76dfadf798d8e","observation_id":"928b9da8-5f40-40aa-971a-76b986046821","resolution":{"observed_at":"2026-08-11T04:18:11.076461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T04:18:11.081607Z","title":"Beining Wang, Weihang Su, Hongtao Tian, Tao Yang, Yujia Zhou, Ting Yao, Qingyao Ai, and Yiqun Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.081607Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:14d4cca4421404aeb56f3c076d38a64d2e96736f4249df5cdcd3f28313c54b55","observation_id":"a61de5b6-5a26-4e55-84ce-97b33d266fbe","resolution":{"observed_at":"2026-08-11T04:18:11.081607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-11T04:18:11.086784Z","title":"Peiyi Wang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.086784Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:b20193c0988a6957727724de43e190d85be9717ee6d48391965b0c680f0b31f1","observation_id":"f5e30d92-2f1f-40ae-8c06-6fc1ad964346","resolution":{"observed_at":"2026-08-11T04:18:11.086784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-11T04:18:11.091647Z","title":"Jiayun Wu et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.091647Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:02b961029d9b6956c7317b27183e72c38aee66f77f919639b90ca94f44c18699","observation_id":"3c0b3d1d-a3da-4811-8d8c-9bf99f87963d","resolution":{"observed_at":"2026-08-11T04:18:11.091647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:11.361402Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":"63f1abfd-2a04-48ae-8a9e-a17d26536891","year":2018},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.097139Z"},"links":{"citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:2b1e5bce0d0a37d7858e89cd4df9ba56b601aafe8da6b70e7d3bd72ebdb7e402","observation_id":"15392555-41bc-488d-9c08-e7e00bd8c9fb","resolution":{"observed_at":"2026-08-11T04:18:11.368928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-11T04:18:11.107248Z","title":"Yiyao Zhang, Diksha Goel, Hussain Ahmad, and Jun Shen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.107248Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:085c0d378f03887cd5d08ecdc56d2f3584afce44da4bd062197dbad1823f6584","observation_id":"12235552-9bb1-4cdf-aa37-c5782f4aaa01","resolution":{"observed_at":"2026-08-11T04:18:11.107248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-11T04:18:11.112009Z","title":"Matched here","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.112009Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:9d818d9944bba9820163905718f880dfa8e0ea734c59bebf2ce5530eebbe84e5","observation_id":"4b695ca7-2953-4cd4-8267-83efb4937583","resolution":{"observed_at":"2026-08-11T04:18:11.112009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:18:11.102124Z","title":"doi: 10.18653/v1/D18-1259","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.102124Z"},"links":{"citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:d6f39adf23c2fea6cf70078ced3b6aa938e32d9cb0550a3d1d1505cdf96974a2","observation_id":"741af49e-e7b8-48f2-a4c7-fa7288e9f527","resolution":{"observed_at":"2026-08-11T04:18:11.102124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T04:18:11.043369Z","title":"Jiawei Gu, Xuhui Jiang, Zhichao Shi, Hexiang Tan, Xuehao Zhai, Chengjin Xu, Wei Li, Yinghan Shen, Shengjie Ma, Honghao Liu, Yuanzhuo Wang, and Jian Guo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.043369Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:4b45cc2111d952725cff225c94331f51060bab6b6575af8815bf6062516586bd","observation_id":"c6f116b2-f598-4d8d-aa97-87f9135693f8","resolution":{"observed_at":"2026-08-11T04:18:11.043369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13528","last_updated":"2023-07-26T15:17:49Z","snapshot_observed_at":"2026-08-13T10:48:15.878453Z","submitted_at":"2023-07-25T14:20:51Z","title":"FacTool: Factuality Detection in Generative AI -- A Tool Augmented Framework for Multi-Task and Multi-Domain Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13528","snapshot_observed_at":"2026-08-11T04:18:11.038075Z","title":"Karl Cobbe et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.038075Z"},"links":{"cited_paper":"/paper/2307.13528","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:a664a9fd69623b962667f777c17b43ce9a9489d81ad8857d02b05a6fff25d4d9","observation_id":"50a2fe24-2a3a-43d7-b97e-4cd1651ea685","resolution":{"observed_at":"2026-08-11T04:18:11.038075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-08-12T20:38:07.563701Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-11T04:18:11.032070Z","title":"Nafew Azim, Abrar Ur Alam, Hasan Bin Omar, Abdullah Mohammad Muntasir Adnan Jami, Jawad Ibn Ahad, Muhammad Rafsan Kabir, Md","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.032070Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:09f0a940315391f948a8089270dc1afe69389ecfd3254832715dc94807b256e8","observation_id":"705fdad2-3aba-444a-9f4c-cd2385e72fc3","resolution":{"observed_at":"2026-08-11T04:18:11.032070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20018","last_updated":"2025-08-27T16:27:19Z","snapshot_observed_at":"2026-08-15T13:03:03.060918Z","submitted_at":"2025-08-27T16:27:19Z","title":"SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20018","snapshot_observed_at":"2026-08-11T04:18:11.054622Z","title":"Ng, and Ping Luo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T04:18:11.054622Z"},"links":{"cited_paper":"/paper/2508.20018","citing_paper":"/paper/2608.07813"},"observation_digest":"sha256:929a976281ce95dfcd2087ecf44a5ea98d0e6a5767f6954479b65591cab3d97e","observation_id":"d7be8218-0e2a-4828-bc27-b9e00949bb21","resolution":{"observed_at":"2026-08-11T04:18:11.054622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07813","last_updated":"2026-08-07T23:23:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T19:35:12.024717Z","submitted_at":"2026-08-07T23:23:00Z","title":"When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2608.07813."}