{"as_of":"2026-08-20T17:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c3168bc21684fe4c92d0aacf2500babda03839d3d7929cfe31e154629bf8afb","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:24:25.365824Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08459/citation-record","integrity":"/paper/2507.08459/integrity","json":"/paper/2507.08459/citation-record.json","paper":"/paper/2507.08459"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:23:25.964780Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:25.964780Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:1eca9cf343f82d8caccd1803b8b075b544b7b609f7bfa2a8f394f9ef6426db44","observation_id":"e9f3ca66-a025-414b-b31d-d8abe431ff86","resolution":{"observed_at":"2026-08-06T18:23:25.964780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.622876Z","title":null,"venue":null,"work_id":"8fdf053c-3df0-496f-9c74-45712e389989","year":2022},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:26.044365Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:a97bfe0e3b7b00a164933f81c0d86302c8b064f107f4a0c3539ffd14b4c4f904","observation_id":"bceabd59-e50c-4f18-9e7f-45e9b482c200","resolution":{"observed_at":"2026-08-06T18:24:52.691946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:26.134301Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:26.134301Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:e7ed64c685625d0ca871dbea62df9ffbe5e0d30189afea9a82169aa7c4be9ea7","observation_id":"087caa4c-7d4a-44f4-a55c-aa2fdb1bbc54","resolution":{"observed_at":"2026-08-06T18:23:26.134301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.01294","last_updated":"2022-03-07T22:34:20Z","snapshot_observed_at":"2026-08-19T00:11:35.202861Z","submitted_at":"2021-07-02T22:37:03Z","title":"Is GPT-3 Text Indistinguishable from Human Text? Scarecrow: A Framework for Scrutinizing Machine Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.01294","snapshot_observed_at":"2026-08-06T18:23:26.267312Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:26.267312Z"},"links":{"cited_paper":"/paper/2107.01294","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:8f4b961f747bb939463a85f373ccb2bb85b5f900d16f3f19ec16650e677d62ab","observation_id":"daeef872-b5e5-4936-a120-bb95b156681a","resolution":{"observed_at":"2026-08-06T18:23:26.267312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.492256Z","title":null,"venue":null,"work_id":"4ee65fc6-234d-46ee-a5ca-10fbd434aa36","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:26.546769Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:4bb524cf193777d82a98f499b7e96d81d90be8222c1ff8f346e93302c31728e2","observation_id":"dd0c1e34-8861-4974-b231-e7639806c440","resolution":{"observed_at":"2026-08-06T18:24:52.555856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T18:23:27.817012Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:27.817012Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:c33b1a4895e616f25cb091bf9d9b24b4031546bc3008cc09bd2939a09beb2abd","observation_id":"ca89c17d-2ea3-4b50-a655-d9ba32c648f0","resolution":{"observed_at":"2026-08-06T18:23:27.817012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.291818Z","title":null,"venue":null,"work_id":"0f34d926-ad75-486e-9d65-3e221418f207","year":2022},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:28.921162Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:61ec425ef933175080f6905fceb6a02a56bbf93d8391c14d0bf4a117d4a8c11e","observation_id":"873abe80-539f-48fc-8894-b77aa8dcbd3b","resolution":{"observed_at":"2026-08-06T18:24:52.391359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:29.038244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.038244Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:f7f9cb0a801db786692ba6af7de35bfcae63f2cc3fafbc6fc5b3a520868374c2","observation_id":"4e139474-0b9b-416a-90d1-69540bcde926","resolution":{"observed_at":"2026-08-06T18:23:29.038244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.006135Z","title":null,"venue":null,"work_id":"5c560dde-cb2f-4607-a3da-7aab3e445175","year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.156199Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:0e827c2dfa80d274a115167cc0619dae1be69f1322bff3fa911a7d3d94ca80fd","observation_id":"562f96b2-321b-45c1-b913-0a0329011e3a","resolution":{"observed_at":"2026-08-06T18:24:52.113547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03602","last_updated":"2024-07-27T22:01:50Z","snapshot_observed_at":"2026-08-16T14:03:33.550490Z","submitted_at":"2024-04-04T17:19:47Z","title":"Evaluating LLMs at Detecting Errors in LLM Responses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03602","snapshot_observed_at":"2026-08-06T18:23:29.325939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.325939Z"},"links":{"cited_paper":"/paper/2404.03602","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:4f3951c80a9bccfc3fd664d62c1274c1ffb9c1f6faeee4a439206396c0c94a7b","observation_id":"48bbf629-5b02-4954-b96c-268df6e33240","resolution":{"observed_at":"2026-08-06T18:23:29.325939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01297","last_updated":"2024-12-03T19:14:06Z","snapshot_observed_at":"2026-08-18T10:44:14.134406Z","submitted_at":"2024-06-03T13:05:46Z","title":"When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01297","snapshot_observed_at":"2026-08-06T18:23:29.536585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.536585Z"},"links":{"cited_paper":"/paper/2406.01297","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:d17110c0298e94bdc93dd9232bc442593e8c660958048ea39e8021d156cf7d06","observation_id":"57a8272d-7e70-4836-b9c1-cf6b5f51b41c","resolution":{"observed_at":"2026-08-06T18:23:29.536585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.891370Z","title":null,"venue":null,"work_id":"a17073e3-0833-4d2b-8bd9-13f48a89f55b","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.705529Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:3029d002c177cebcb48e641a36c120069715ab83b1c90801fd3033a0f209dc2b","observation_id":"7d6f9917-e9a8-4f87-9421-077fbc91221b","resolution":{"observed_at":"2026-08-06T18:24:51.925597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:29.831673Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.831673Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:6d2b459bf43b5fd42e9b3264124852f8901a31076c821b85d87b668dc88891b5","observation_id":"5571812b-aa64-4fc1-b3b2-dcbcde42b081","resolution":{"observed_at":"2026-08-06T18:23:29.831673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T18:23:29.935279Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:29.935279Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:1acc84b99a04f127bc77040c23e43341d4203cf35bd43c7469d714f33ac7bb82","observation_id":"ba518ebf-4f5b-45a9-98e3-d4b01ab32bd2","resolution":{"observed_at":"2026-08-06T18:23:29.935279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06332","last_updated":"2021-05-19T12:01:54Z","snapshot_observed_at":"2026-08-16T18:39:47.393012Z","submitted_at":"2021-03-10T20:32:30Z","title":"Hurdles to Progress in Long-form Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06332","snapshot_observed_at":"2026-08-06T18:23:30.057653Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.057653Z"},"links":{"cited_paper":"/paper/2103.06332","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:10a85e7a9f05eed2a3a9c9ee96af33e92fbb9837247f08f6caa6c0195a4197bc","observation_id":"2f88b4fc-64f0-4dcb-8586-2d357059a6bc","resolution":{"observed_at":"2026-08-06T18:23:30.057653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:30.169471Z","title":null,"venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.169471Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:9de5033329006405e491cb92c33d08b674f0d550c3dc91cf681d2d7b0dbce8cd","observation_id":"fa3ef39b-e07e-4236-9eb8-7daeb66490a9","resolution":{"observed_at":"2026-08-06T18:23:30.169471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:30.235940Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.235940Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:bcef88ae20990ddc80317d6d1a4d71a9a5e0c98e206243d1db1c39ec837a2349","observation_id":"735d5c09-e9e6-4558-8dcf-8a0435284eef","resolution":{"observed_at":"2026-08-06T18:23:30.235940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.768112Z","title":null,"venue":null,"work_id":"74c7606b-2335-4673-b898-0f0178f2a6c5","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.359679Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:1f629abc7fce210ca8555e653d3a96f663c3b0e5190c4b52513423eb8d55fe95","observation_id":"be05120e-00ae-43bf-9769-bcbd31e2cae9","resolution":{"observed_at":"2026-08-06T18:24:51.824361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18743","last_updated":"2024-08-25T09:58:57Z","snapshot_observed_at":"2026-08-20T06:25:25.951224Z","submitted_at":"2023-11-30T17:41:30Z","title":"AlignBench: Benchmarking Chinese Alignment of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18743","snapshot_observed_at":"2026-08-06T18:23:30.510620Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.510620Z"},"links":{"cited_paper":"/paper/2311.18743","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:9d9db50e511b26ee8b5fae2fe01a02889caf54e0ab36411df5453130e7d607af","observation_id":"2a47dbe2-5407-4ed4-b574-e7ec36c316b5","resolution":{"observed_at":"2026-08-06T18:23:30.510620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.642502Z","title":null,"venue":null,"work_id":"5edd009a-c9a5-4d9b-97c3-4dc16576e32a","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.634447Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:815bc92450b853733585ada34f8616ba09226663b3e62c7b643fab6efddf9535","observation_id":"c4f9a607-a61e-4c25-9b0b-7c0727169d30","resolution":{"observed_at":"2026-08-06T18:24:51.710663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-06T18:23:30.789112Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.789112Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:bf4bf3adddd8ce620ef27dc1318244c84cc81109836a28c7f703d2d31a447b84","observation_id":"5e30c80b-8e26-43c0-84ea-abf8d040141e","resolution":{"observed_at":"2026-08-06T18:23:30.789112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.550130Z","title":null,"venue":null,"work_id":"a520a0c0-9098-4dff-af42-569572966c19","year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:30.924621Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:022f3b7101150496940c29355eb0187bb0c4211eeb1018d421d0a83afa23387f","observation_id":"3f201c77-f884-4c8b-bfec-3a2fa0a0d2d9","resolution":{"observed_at":"2026-08-06T18:24:51.591337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:31.040317Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.040317Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:6a7fc1ae6017172999b94942b3858f77d61906fafec8ff955e71900c6abebbbd","observation_id":"80daa32e-9cd3-4174-ac5b-a29a1739c9a7","resolution":{"observed_at":"2026-08-06T18:23:31.040317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:31.175323Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.175323Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:9268c6a92f14129ac9f9719fd2a9a92971420e66b44d6e906d1ee01dfe43256d","observation_id":"eba66bd4-0b87-4b38-ba5d-34b3ba918326","resolution":{"observed_at":"2026-08-06T18:23:31.175323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.458785Z","title":null,"venue":null,"work_id":"13269d52-b532-4f51-b8b2-f41a23056f9c","year":2021},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.298506Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:2cbc519de4fce1baa52de478df4961ad7ed6a6f98e2b1b6a7282e6817c5a9682","observation_id":"6274dd55-b188-4be7-bfbd-cf141b850aa3","resolution":{"observed_at":"2026-08-06T18:24:51.488387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:31.410452Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.410452Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:9b47d4238b2bcb9d641d32f5fb1886d649abaa6134ec4b2db9e4197df86eae1e","observation_id":"904dc09d-dc34-4f07-b765-b10a73164ad0","resolution":{"observed_at":"2026-08-06T18:23:31.410452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08487","last_updated":"2023-08-28T08:35:28Z","snapshot_observed_at":"2026-08-20T14:42:30.786955Z","submitted_at":"2023-07-17T13:49:52Z","title":"Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08487","snapshot_observed_at":"2026-08-06T18:23:31.499480Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.499480Z"},"links":{"cited_paper":"/paper/2307.08487","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:ec578c487058c4c043e9d7848c5a7d8d67f077d22472fe663791e4038eb08644","observation_id":"07c841b8-0bba-451b-8d83-2bd5866d92ff","resolution":{"observed_at":"2026-08-06T18:23:31.499480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:31.587962Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.587962Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:a2388e764d08d990a8749dcbb4d61bb94724aabd156439240d998d6eb40e14c8","observation_id":"db74c65a-fc59-4d18-9e1c-b82356c29856","resolution":{"observed_at":"2026-08-06T18:23:31.587962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.331213Z","title":null,"venue":null,"work_id":"51620eab-b977-48e0-98c5-1ee1ff7b8309","year":2020},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.705758Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:2669407fdf2a328b5416b892e3727592a18f69d0e4418c54133ef9009afd9d6d","observation_id":"dda5ec9b-2c13-4531-800e-83d248164164","resolution":{"observed_at":"2026-08-06T18:24:51.396815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04696","last_updated":"2020-05-21T16:53:47Z","snapshot_observed_at":"2026-08-18T19:40:05.706404Z","submitted_at":"2020-04-09T17:26:52Z","title":"BLEURT: Learning Robust Metrics for Text Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04696","snapshot_observed_at":"2026-08-06T18:23:31.866770Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:31.866770Z"},"links":{"cited_paper":"/paper/2004.04696","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:8317d1927a88f2f54dc513d61dc4a318e54b2b0710921828db2a1bf7006f7348","observation_id":"cf087154-cc14-41c2-9010-7e91381fee32","resolution":{"observed_at":"2026-08-06T18:23:31.866770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15185","last_updated":"2024-05-24T03:39:31Z","snapshot_observed_at":"2026-08-16T21:31:37.916228Z","submitted_at":"2024-05-24T03:39:31Z","title":"An Evaluation of Estimative Uncertainty in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15185","snapshot_observed_at":"2026-08-06T18:23:32.007106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.007106Z"},"links":{"cited_paper":"/paper/2405.15185","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:5a539a5f6a5f6b79fcc5d30e7aca98643b019ac97d8d361c48b61aa027bceef5","observation_id":"2bf083f1-b564-47bc-a6ea-d2d2109194a6","resolution":{"observed_at":"2026-08-06T18:23:32.007106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.182231Z","title":null,"venue":null,"work_id":"a43a09e4-ef8f-4ebd-bde0-fa77b6f3e5bd","year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.186651Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:bb0e2c557d6591f7f58a39a872dea8416d140b9a4d377fe2d5ec05d5bbddd360","observation_id":"fc21d2d3-d84d-4142-ae6a-3c2f76315369","resolution":{"observed_at":"2026-08-06T18:24:51.251462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.057414Z","title":null,"venue":null,"work_id":"cfcdd7db-6717-4873-a0d0-a3bcf4bb5988","year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.283977Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:797eb5feacad729410143ce072fa57ea2d660ffefa1cd48a4138d7c3c41bd481","observation_id":"9552394f-21cb-4785-8ec1-db3052d5d66e","resolution":{"observed_at":"2026-08-06T18:24:51.095486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:32.421179Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.421179Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:2d7e6e646764ccfd7481ac3118e3f6b7007a31ee30913444341986928e4aabd6","observation_id":"af2b1c80-2ff6-43b1-b8da-20d7b264fe99","resolution":{"observed_at":"2026-08-06T18:23:32.421179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05374","last_updated":"2023-11-09T13:58:59Z","snapshot_observed_at":"2026-08-16T14:44:39.615238Z","submitted_at":"2023-11-09T13:58:59Z","title":"TencentLLMEval: A Hierarchical Evaluation of Real-World Capabilities for Human-Aligned LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05374","snapshot_observed_at":"2026-08-06T18:23:32.541837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.541837Z"},"links":{"cited_paper":"/paper/2311.05374","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:3b8f5bfba476330081a48857f0880a3e98b875fbc3935d51a0b0c78fb10ae34a","observation_id":"b9047dcf-9bc5-460a-b1de-1f413897c989","resolution":{"observed_at":"2026-08-06T18:23:32.541837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-06T18:23:32.668859Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.668859Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:7b0044b2ba92df8a6f7387af03bd8c42f46872941eacf9ee50f5def2530bbe41","observation_id":"8e70f680-dd88-44ff-a16e-d9d201a75cf7","resolution":{"observed_at":"2026-08-06T18:23:32.668859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T18:23:32.810642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.810642Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:217a8d7757bcb9cf932bdab2c1063676df3e2a3e16879631a9866ab7027f35c4","observation_id":"379b55f4-7887-46ec-9982-53634e19f60e","resolution":{"observed_at":"2026-08-06T18:23:32.810642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00934","last_updated":"2025-05-29T06:15:38Z","snapshot_observed_at":"2026-08-16T13:38:17.181281Z","submitted_at":"2024-07-01T03:35:58Z","title":"CLEME2.0: Towards Interpretable Evaluation by Disentangling Edits for Grammatical Error Correction","version":2},"cited_work":{"arxiv_id":"2407.00934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.00934","snapshot_observed_at":"2026-08-06T18:24:25.924190Z","title":"CLEME2.0: Towards Interpretable Evaluation by Disentangling Edits for Grammatical Error Correction","venue":"cs.CL","work_id":"ae0b965f-53cf-476a-a00d-47ca7204b420","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:32.952221Z"},"links":{"cited_paper":"/paper/2407.00934","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:030da0ad9ccebca09aa10e86e6071a094ed3064977f28739d57274e2a15d0c05","observation_id":"d35a0f33-98a2-4ad1-b83f-8a89cc39c756","resolution":{"observed_at":"2026-08-06T18:24:26.000398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.877375Z","title":null,"venue":null,"work_id":"44dfe1d4-f8ed-458d-a1c9-4e13af46853a","year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.076234Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:5ab0afeca843c9d1cac4cf14e3a15f9a092d2476457b9f2b6a2785f2c4afff20","observation_id":"591f0708-ece6-40b7-810c-6725e078873e","resolution":{"observed_at":"2026-08-06T18:24:50.965748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.724469Z","title":null,"venue":null,"work_id":"75ad8fa5-9713-49d5-b3f3-d21f2ce1ba02","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.161093Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:25d8484af312442c20c6023fc17a664834c82840e02ff24dc44de85b6cea72d1","observation_id":"09dd2b4b-40be-4975-b7a2-157396507eef","resolution":{"observed_at":"2026-08-06T18:24:50.779910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.512569Z","title":null,"venue":null,"work_id":"7a9d2e0b-077f-4eb9-b633-d6a5eb85a045","year":2022},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.266794Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:81568e1f742b8b5296fccd1e2b8fdc4fe38c1ce04cf1dc093fb44ebc52813033","observation_id":"7b20d8df-ac1b-496a-a097-1d89ee5bbfff","resolution":{"observed_at":"2026-08-06T18:24:50.639692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:33.455203Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.455203Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:d0ba69abc69f93d46d1c74c159b11ffbee198bb25845e45e57e5ef5ea27bd134","observation_id":"a2954a49-8c1b-4732-9f4c-81e9249efe94","resolution":{"observed_at":"2026-08-06T18:23:33.455203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:23:33.619260Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.619260Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:ff3525691ab2bd011b08a44e36a0e7fd58d28435bb76c6e0eeb44393838acf4b","observation_id":"f2b1e598-297e-45f7-8a1a-89b5a38ccf94","resolution":{"observed_at":"2026-08-06T18:23:33.619260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.367786Z","title":null,"venue":null,"work_id":"a7de019c-6e5a-41e6-9274-3f60ef4cd005","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.756105Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:45ffbc4667efc99cce865e3b21cfe00346ee809b31b96c7041a648ec8e9f41ee","observation_id":"b53d66ca-2f09-41b2-952a-1d404cc047e2","resolution":{"observed_at":"2026-08-06T18:24:50.455163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13534","last_updated":"2023-05-22T23:14:28Z","snapshot_observed_at":"2026-08-20T13:09:49.499190Z","submitted_at":"2023-05-22T23:14:28Z","title":"How Language Model Hallucinations Can Snowball","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13534","snapshot_observed_at":"2026-08-06T18:23:33.820869Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.820869Z"},"links":{"cited_paper":"/paper/2305.13534","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:28585027de1bd175502ec2c98ac65c565c46d7de6cc33e7295b49ad6e67fe6a1","observation_id":"934eadb4-79da-4b40-b25f-77842ad93286","resolution":{"observed_at":"2026-08-06T18:23:33.820869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:26.524437Z","title":null,"venue":null,"work_id":"971428bf-503d-44ed-9d4c-8c319749c7ca","year":2023},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:33.928765Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:607e08ba3a44a17afbe16eee2cbe445f667fc5932ca5c556c0b80b31973a109e","observation_id":"78f0b18e-bb5a-48c5-b3ef-75290c5973ba","resolution":{"observed_at":"2026-08-06T18:24:26.580953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T18:23:34.057930Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:34.057930Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:f69eee5251a8d91df359f9b3a8161167dd154064d21a95fe43981ad0c9056de0","observation_id":"a2e2b92a-8308-4e67-8c34-04a422f9ed34","resolution":{"observed_at":"2026-08-06T18:23:34.057930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:26.343818Z","title":null,"venue":null,"work_id":"9080df38-36a3-4458-ab00-ea43ed6b89be","year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:34.118699Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:4489346ec4e27c723dfbc19475de47dd881a1d21b5d0e404c5c45cbf1443cb59","observation_id":"af0f8471-c3fc-4637-8ef5-efd3a5bbd331","resolution":{"observed_at":"2026-08-06T18:24:26.445899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T18:23:34.253802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:34.253802Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:bde67f05a0ebd2fba67a5de2ae3ada80913ae1f2dadf3a08c1e2cef35948f504","observation_id":"35ee36bb-eb0c-467b-9e1b-542ec4faea67","resolution":{"observed_at":"2026-08-06T18:23:34.253802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19163","last_updated":"2025-05-31T07:53:48Z","snapshot_observed_at":"2026-08-16T12:54:59.927634Z","submitted_at":"2025-02-26T14:17:56Z","title":"TestNUC: Enhancing Test-Time Computing Approaches and Scaling through Neighboring Unlabeled Data Consistency","version":2},"cited_work":{"arxiv_id":"2502.19163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19163","snapshot_observed_at":"2026-08-06T18:24:25.551299Z","title":"TestNUC: Enhancing Test-Time Computing Approaches and Scaling through Neighboring Unlabeled Data Consistency","venue":"cs.CL","work_id":"c077c796-b233-4a39-b777-6ba0e0604309","year":2025},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:23:34.988269Z"},"links":{"cited_paper":"/paper/2502.19163","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:940f5013b05ea56d8362cfa641c03c817b8d24ba2e03d40e23f4d0c9b7bfdfdf","observation_id":"a80be7d0-c60d-499b-8818-86f40939115b","resolution":{"observed_at":"2026-08-06T18:24:25.603576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00753","last_updated":"2026-05-06T06:53:19Z","snapshot_observed_at":"2026-08-14T01:16:16.080437Z","submitted_at":"2025-05-01T08:29:26Z","title":"LLM-Based Human-Agent Collaboration and Interaction Systems: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00753","snapshot_observed_at":"2026-08-06T18:24:24.616624Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:24.616624Z"},"links":{"cited_paper":"/paper/2505.00753","citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:19909b69a21226e96db9d40572163498715c5ede47e7568f154165731cf1342c","observation_id":"da1fbe93-ca5d-4106-942e-38b30c5a861a","resolution":{"observed_at":"2026-08-06T18:24:24.616624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:25.121221Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:25.121221Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:cd786a55fa585d68112ed21f678a0ef38c178fa270a665d3caf293fa0c1315fa","observation_id":"9e25c57e-e625-40ab-8761-8810550af946","resolution":{"observed_at":"2026-08-06T18:24:25.121221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:25.365824Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:25.365824Z"},"links":{"citing_paper":"/paper/2507.08459"},"observation_digest":"sha256:122003f687c269a153300f550793397175ccb2a2890223fc54372368e97afa95","observation_id":"56846acc-24c5-42e6-8a60-d09a7ba6dcec","resolution":{"observed_at":"2026-08-06T18:24:25.365824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08459","last_updated":"2025-07-11T10:02:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T05:15:54.610872Z","submitted_at":"2025-07-11T10:02:21Z","title":"Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2507.08459."}