{"as_of":"2026-08-17T16:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b4280e41d4e8c81e9cb2d2203c5f6e839f4ff07d9f5097dffb56f5e07e2359e","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:06:02.229517Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25152/citation-record","integrity":"/paper/2607.25152/integrity","json":"/paper/2607.25152/citation-record.json","paper":"/paper/2607.25152"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-16T01:26:19.355671Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09863","snapshot_observed_at":"2026-07-31T00:05:59.121624Z","title":"From Confident Closing to Silent Failure: Characterizing False Suc - cess in LLM Agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.121624Z"},"links":{"cited_paper":"/paper/2606.09863","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:c3865ecc58659f5fef1c8b154e29e2134b78f83589cfc6a21affed0ca03799df","observation_id":"ba35ee0c-a4db-435c-9a67-67491996ea4a","resolution":{"observed_at":"2026-07-31T00:05:59.121624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-31T00:05:59.584002Z","title":"Constitutional AI: Harmlessness from AI Feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.584002Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:95bf259085a2b364b01eedf167a4d85ed75dabcd62af54f240c8798318f3bfbe","observation_id":"1ba18b0d-4372-4b9e-9146-a5d73a93a127","resolution":{"observed_at":"2026-07-31T00:05:59.584002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-16T14:34:35.228009Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-07-31T00:05:59.702622Z","title":"Weak-to-Strong General - ization: Eliciting Strong Capabilities with Weak Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.702622Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:a59246d0c9ead9e8ca1522e3be9fc8b9e76c07e04f28a635787d44e98105358a","observation_id":"bb4a6551-b82f-4d42-a567-e2e50ff28a51","resolution":{"observed_at":"2026-07-31T00:05:59.702622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07774","snapshot_observed_at":"2026-07-31T00:05:59.839451Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.839451Z"},"links":{"cited_paper":"/paper/2607.07774","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:041a717d7acdc4faa28970ca7d5ff142f4f9a7512cba9e7b5a6d3316bfefffe7","observation_id":"c3296c37-e76f-455f-9bad-bc9a8554d11a","resolution":{"observed_at":"2026-07-31T00:05:59.839451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:05:59.907437Z","title":"Deep Re- inforcement Learning from Human Prefer - ences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.907437Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:a50918758b27ecf1b63eb9582307c5ee65b7db1705645a862b30b4e39931c8ff","observation_id":"c371ef5f-2110-42c9-b13b-004fbc0ba343","resolution":{"observed_at":"2026-07-31T00:05:59.907437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21654","last_updated":"2026-05-17T22:54:07Z","snapshot_observed_at":"2026-08-15T21:09:52.541176Z","submitted_at":"2025-11-26T18:27:17Z","title":"EvilGenie: A Reward Hacking Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21654","snapshot_observed_at":"2026-07-31T00:06:00.011035Z","title":"Evil- Genie: A Reward Hacking Benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.011035Z"},"links":{"cited_paper":"/paper/2511.21654","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:8d1099af4f3f79f6e95406316bc111d492123a54e26a8cabd43dd38082793ed0","observation_id":"b9e21d03-5745-4716-9552-e616413f705c","resolution":{"observed_at":"2026-07-31T00:06:00.011035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.086887Z","title":"Scal - ing Laws for Reward Model Overoptimiza- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.086887Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:ae43f5dbc8be83635e89ff124f770ea7420b4561a95b0199d653a57a859a176f","observation_id":"df82bd36-55ea-4ca2-a8aa-20f4bd708f46","resolution":{"observed_at":"2026-07-31T00:06:00.086887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.137455Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.137455Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:389399e4791b1ca14c2841c1329ea4cb4d952b0a0bbd4a3baf1097e91ed5f8f2","observation_id":"9d69b39d-f819-499e-8920-194b40d65375","resolution":{"observed_at":"2026-07-31T00:06:00.137455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-14T21:47:20.607853Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-07-31T00:06:00.192018Z","title":"AI Safety via Debate,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.192018Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:42fdad9a726dc5e20c64fa103f51adbf704555e6687df7653c73cc9b0ea97297","observation_id":"912e8103-f563-4ad6-b9e9-e9a808abea03","resolution":{"observed_at":"2026-07-31T00:06:00.192018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.347221Z","title":"Controlled Exper- iments on the Web: Survey and Practical Guide,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.347221Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:d6949b2da5dc2e06095d559c3153c7ac5a065b7f2470a935b26ef3494bb0a271","observation_id":"7f926ccb-1d5e-4c05-9e73-e560f5900863","resolution":{"observed_at":"2026-07-31T00:06:00.347221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-15T21:31:17.600844Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-31T00:06:00.562062Z","title":"Scalable Agent Alignment via Reward Modeling: A Research Direction,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.562062Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:e27f92319c7019424f984e7fa08921484a5d2acd67afa0579d4d6e2483c95fcc","observation_id":"8aba963f-f187-4d10-82b5-07710c08c0d8","resolution":{"observed_at":"2026-07-31T00:06:00.562062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01365","last_updated":"2026-05-31T17:50:11Z","snapshot_observed_at":"2026-08-15T06:23:27.181746Z","submitted_at":"2026-05-31T17:50:11Z","title":"Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01365","snapshot_observed_at":"2026-07-31T00:06:00.611392Z","title":"Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.611392Z"},"links":{"cited_paper":"/paper/2606.01365","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:6d69461a410d3be2865cd1bf0fc78cce9aa7f4181594ef219ae6f3176f63c57e","observation_id":"7f0ccc12-c41a-48c8-98fb-179d494630ee","resolution":{"observed_at":"2026-07-31T00:06:00.611392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.693551Z","title":"Let’s Verify Step by Step,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.693551Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:b7e33d90e1a6929a975e024141ce699dc97fc8e3fa752b46d25a49beb063cd51","observation_id":"b7441adf-2310-4c39-991d-6033c8b791bc","resolution":{"observed_at":"2026-07-31T00:06:00.693551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.752157Z","title":"Retrospec- tive Progress-Aware Self-Refinement for LLM Agent Training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.752157Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:609dc6dd25eb267323da1d64470b86df93307974b803b7d0e1735620b8b08aac","observation_id":"9a0517dc-6130-461b-893c-de4ab8ddb17b","resolution":{"observed_at":"2026-07-31T00:06:00.752157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.814656Z","title":"Self-Refine: Iterative Refinement with Self-Feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.814656Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:1df33a9edee89d6d1a3109c909db676e1f32764ee2dd69b29624bafc62981a23","observation_id":"effd6ed5-f217-46d1-9037-895159e7c9f4","resolution":{"observed_at":"2026-07-31T00:06:00.814656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04585","last_updated":"2019-02-24T08:12:46Z","snapshot_observed_at":"2026-08-17T04:25:53.281214Z","submitted_at":"2018-03-13T01:15:39Z","title":"Categorizing Variants of Goodhart's Law","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04585","snapshot_observed_at":"2026-07-31T00:06:00.865901Z","title":"Cate - gorizing Variants of Goodhart’s Law,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.865901Z"},"links":{"cited_paper":"/paper/1803.04585","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:4e5d073bee73e641f31bb21460da8bc3a6635abc150b2d92370d75212dfb55b9","observation_id":"21f9bc9a-3029-432d-8d7d-9d4c6c2dffde","resolution":{"observed_at":"2026-07-31T00:06:00.865901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.931998Z","title":"Training Language Mod- els to Follow Instructions with Human Feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.931998Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:cf01387e30fac241911f1ef4f97c57a9e5e7d0138a8376258664c1ce8b6f86a1","observation_id":"c60514e2-ca06-4acd-b210-8d964cfcb204","resolution":{"observed_at":"2026-07-31T00:06:00.931998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:01.033058Z","title":"The Effects of Reward Misspecification: Map - ping and Mitigating Misaligned Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.033058Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:d3cb0926700fc2010d0a4dd13bd8c07f0a1fe82667d8d3e71b2c703479a2bbf0","observation_id":"4b084f1d-6454-4fbe-bb3b-74e0c7ff3cf0","resolution":{"observed_at":"2026-07-31T00:06:01.033058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04549","last_updated":"2024-07-05T14:34:50Z","snapshot_observed_at":"2026-08-16T13:36:45.837914Z","submitted_at":"2024-07-05T14:34:50Z","title":"Spontaneous Reward Hacking in Iterative Self-Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04549","snapshot_observed_at":"2026-07-31T00:06:01.103945Z","title":"Spontaneous Reward Hacking in Itera - tive Self-Refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.103945Z"},"links":{"cited_paper":"/paper/2407.04549","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:973836aac0224278cc4b8968f44ce969927bacfd529d7865ec25cacde3d398b9","observation_id":"0e0dc9f1-da99-491f-9b26-d10498874b10","resolution":{"observed_at":"2026-07-31T00:06:01.103945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:01.201590Z","title":"LLM Evaluators Recognize and Fa- vor Their Own Generations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.201590Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:154a2ba257c5a96780cfea359738680f39bac84a3782a15bcad549ab6936a33d","observation_id":"06b0bd32-9eb6-4620-8bb7-18cbf470cd0a","resolution":{"observed_at":"2026-07-31T00:06:01.201590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:01.307077Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.307077Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:797628ab34b2e1d7677cbd24087f8b4251ff78bf1048dfd4eff62dbc915540ce","observation_id":"37e51bc7-4821-4415-a6bb-a23c9b3c4d78","resolution":{"observed_at":"2026-07-31T00:06:01.307077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:01.395358Z","title":"Defining and Char- acterizing Reward Hacking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.395358Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:381ab2687dd30ea7f7cea757c48cc01985a2430ea421680ccf38b4d2ce663763","observation_id":"e5889ad6-d8e6-4686-bbd1-cc028bf4d6d3","resolution":{"observed_at":"2026-07-31T00:06:01.395358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-31T00:06:01.464945Z","title":"Solving Math Word Prob- lems with Process- and Outcome-Based Feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.464945Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:d75694ea88b86f90ba4b179c4b446879b3e71a5b9b34077e3a9da3da19997270","observation_id":"300eacf1-8137-437f-891e-c2b8b8d2333a","resolution":{"observed_at":"2026-07-31T00:06:01.464945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26300","last_updated":"2026-06-29T08:21:30Z","snapshot_observed_at":"2026-08-10T22:31:23.229158Z","submitted_at":"2026-06-24T18:45:03Z","title":"The Verification Horizon: No Silver Bullet for Coding Agent Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26300","snapshot_observed_at":"2026-07-31T00:06:01.599726Z","title":"The Verification Horizon: No Silver Bullet for Coding Agent Re - wards,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.599726Z"},"links":{"cited_paper":"/paper/2606.26300","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:7cbf95a6f34e464e90b3a462aa5eca6cbc0f01809e7544eadcef9d2134d10e40","observation_id":"06b51709-4ae3-4445-b4ac-b6c889540733","resolution":{"observed_at":"2026-07-31T00:06:01.599726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19837","last_updated":"2026-04-21T08:14:09Z","snapshot_observed_at":"2026-08-15T02:37:59.889590Z","submitted_at":"2026-04-21T08:14:09Z","title":"Forage V2: Knowledge Evolution and Transfer in Autonomous Agent Organizations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19837","snapshot_observed_at":"2026-07-31T00:06:01.663729Z","title":"Forage V2: Knowledge Evolution and Transfer in Autonomous Agent Organi- zations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.663729Z"},"links":{"cited_paper":"/paper/2604.19837","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:11b5de77aefcd6651a2174aadd5bbbd47fd18ccdc813d19c483238a7cde7506d","observation_id":"4cac049e-4bbc-4de3-acb2-ad957a09c817","resolution":{"observed_at":"2026-07-31T00:06:01.663729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:01.801069Z","title":"SWE-agent: Agent- Computer Interfaces Enable Automated Software Engineering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.801069Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:22683cd68dc2ec5b327784695b1dc1a9691cbafa964f998e681a930b4393fdb7","observation_id":"12ca15e8-2dee-4054-b2cd-3432047aef7e","resolution":{"observed_at":"2026-07-31T00:06:01.801069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:01.918907Z","title":"ReAct: Syn- ergizing Reasoning and Acting in Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:01.918907Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:f1071018a17d05bafa2fc58457b2e6479f32b403ebe40082fe92588b0db2b3ea","observation_id":"ce56bc70-e032-48e9-b970-c352c3180329","resolution":{"observed_at":"2026-07-31T00:06:01.918907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-14T14:24:18.501413Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-31T00:06:02.005364Z","title":"τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:02.005364Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:e4958b996ae7cea5273719b75e7a25ee6a29ba831935c977f0b186294eca370c","observation_id":"4bd76697-74f8-4787-b2da-f22913978e9a","resolution":{"observed_at":"2026-07-31T00:06:02.005364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21384","last_updated":"2026-05-20T16:41:51Z","snapshot_observed_at":"2026-08-12T12:14:45.033803Z","submitted_at":"2026-05-20T16:41:51Z","title":"SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21384","snapshot_observed_at":"2026-07-31T00:06:02.127727Z","title":"SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:02.127727Z"},"links":{"cited_paper":"/paper/2605.21384","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:6fd49585e7e5b7910ddc47ee073d5b30cbafdc5b01053c438063a11922d86fdb","observation_id":"46f31ed6-b2f3-450c-81d9-0cda687c4198","resolution":{"observed_at":"2026-07-31T00:06:02.127727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:02.229517Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:02.229517Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:9c38e083d05e2d727d06ebcce5e056f53b84dc5a17838d5b8f24fbc9f9e8105a","observation_id":"3e525af4-cf19-4908-a32b-a58f072f4bd4","resolution":{"observed_at":"2026-07-31T00:06:02.229517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.404153Z","title":"Kohavi, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.404153Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:cf046910af88e79a551449269affb272f04360fd3117866d2afa1e24c7bf0330","observation_id":"bb047815-d530-49fb-9be7-bb482fd10599","resolution":{"observed_at":"2026-07-31T00:06:00.404153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:05:59.408979Z","title":"Building Effective AI Agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.408979Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:f35908f07e999fe6cc3e4d3dd8d69bceffe9fa052227eb4ab4441c3e06cab76c","observation_id":"5a7bf308-a0e1-4d9b-9ac3-1e8ecb116fa5","resolution":{"observed_at":"2026-07-31T00:05:59.408979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22737","last_updated":"2026-07-02T03:26:27Z","snapshot_observed_at":"2026-08-13T13:55:02.331932Z","submitted_at":"2026-06-22T00:41:16Z","title":"GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22737","snapshot_observed_at":"2026-07-31T00:05:59.959934Z","title":"GroundEval: A Deterministic Replacement for LLM-as-Judge in State - ful Agent Evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.959934Z"},"links":{"cited_paper":"/paper/2606.22737","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:81626eaab14443168e3e27087afd88f0a61762ed32e014507148627edbb3718a","observation_id":"ceaeaecc-b479-4e83-98fa-9f6965791359","resolution":{"observed_at":"2026-07-31T00:05:59.959934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.294890Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.294890Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:cda3820fce8c5b54187cfedf35cfaac59077e17845b85400884dc9f2270d9069","observation_id":"dbb15f01-af43-4cde-b83f-623c58ad06e1","resolution":{"observed_at":"2026-07-31T00:06:00.294890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:06:00.478706Z","title":"Specification Gaming: The Flip Side of AI Ingenuity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.478706Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:572ec607f7f659aedfa6587bb390d99834ab4387482a2930b6386981783dbe80","observation_id":"9de3934e-92c4-4e34-bcee-718312eaf032","resolution":{"observed_at":"2026-07-31T00:06:00.478706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-07-31T00:05:59.643757Z","title":"Monitoring Reasoning Mod- els for Misbehavior and the Risks of Pro - moting Obfuscation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.643757Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:afbd23e7e2bb9bd7b82dd388279544d95b62a72a80083d26e4245ffea1678243","observation_id":"a7683982-5cd8-4534-b471-02c2786afd19","resolution":{"observed_at":"2026-07-31T00:05:59.643757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:05:59.783791Z","title":"Reward Hack- ing in Language Model Agents: Revisiting AI Safety Gridworlds,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.783791Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:28ded6ce509480f5a2cb637876fb74c0eb9abff8da50a2b29b1bbbcb12d2adab","observation_id":"290563ce-728e-4d18-917d-dcad6186e0c5","resolution":{"observed_at":"2026-07-31T00:05:59.783791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:05:59.450472Z","title":"Effective Harnesses for Long- Running Agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.450472Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:937b230bd49f8aaf1ff3ef86ac12cfe6ca1839ebeac1bbd2a3854488747236b3","observation_id":"27e3f52e-3632-40c0-a007-5f08b151d0ac","resolution":{"observed_at":"2026-07-31T00:05:59.450472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:05:59.528265Z","title":"Reward - HackingAgents: Benchmarking Evalua - tion Integrity for LLM ML-Engineering Agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.528265Z"},"links":{"citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:96cbbda64d84ac55f51143f64cd0477f81ef8dbaff774d4e23350e7c6a8b946c","observation_id":"d1030f6f-d2ce-434f-9943-3b5aac86714d","resolution":{"observed_at":"2026-07-31T00:05:59.528265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-31T00:05:59.249687Z","title":"Concrete Problems in AI Safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:59.249687Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:61d0e61edc024e8d18840424091fd8d7ffcedc318ccd682e8bb94aa594712647","observation_id":"13b1f4b6-1c8e-4072-b87b-7f93880075d9","resolution":{"observed_at":"2026-07-31T00:05:59.249687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T11:44:37.362093Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.25152."}