{"as_of":"2026-08-17T13:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58c677f4d768ba53279b948a08aca6822ea964c9a7ac41e2a3b1eb21b416c194","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:10.932988Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12376/citation-record","integrity":"/paper/2506.12376/integrity","json":"/paper/2506.12376/citation-record.json","paper":"/paper/2506.12376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T00:57:10.821107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.821107Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:aedac8c4d3cd612979dc5f4aca4d1476e78da66248f752da5719c94627860246","observation_id":"4d050e6a-69c9-40f2-929a-0363616f7a0b","resolution":{"observed_at":"2026-08-07T00:57:10.821107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.382038Z","title":null,"venue":null,"work_id":"3bb85ea4-a068-4697-9f37-4a005af304a3","year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.825536Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:72437134aeb4722707469e2d0d96b83aa0e1fe92a76ce0aebc96c03ceb15d065","observation_id":"ad1334f8-3b07-44fe-ba21-7ea852ba5ddf","resolution":{"observed_at":"2026-08-07T00:57:11.385892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.830526Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.830526Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:a506356711f55c452991eb3049f72827f2ab998e8e605bb502606801d7e4b9c4","observation_id":"2f840291-5fd4-41d5-aefd-257aa267c3cd","resolution":{"observed_at":"2026-08-07T00:57:10.830526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.372172Z","title":null,"venue":null,"work_id":"1689e756-fd84-442b-af2b-b93b26919938","year":2018},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.834151Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:cfca7ed510b04f20e2f3448e4eca2754460d40e1fb77b4296a6885febca1ffba","observation_id":"3bd6c51b-ed0b-4e60-8830-8115d7f6ea1a","resolution":{"observed_at":"2026-08-07T00:57:11.375353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T00:57:10.837613Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.837613Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:61ff48ec379a80c8c9b15437fadfd429455d66b99b171ae2bd0796b69d5a08db","observation_id":"8778659d-18f0-4202-a4ae-92c2799d5c1f","resolution":{"observed_at":"2026-08-07T00:57:10.837613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T00:57:10.840876Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.840876Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:652c909bf748cdc320eabd9aecd497d17390a7346d1e7dd5a69ec9e92165ae09","observation_id":"7cfb0def-27cc-495f-a134-7dd54ae0430a","resolution":{"observed_at":"2026-08-07T00:57:10.840876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.362827Z","title":null,"venue":null,"work_id":"c133045c-f478-4ea7-9f94-ad39676efde9","year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.844622Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:1fd8e97b469486cad2aa7e1134aef5a3d37023409a11bb9af73c8e84f5586af6","observation_id":"cb38e085-ba45-4357-baa4-dc0d0c94f7a4","resolution":{"observed_at":"2026-08-07T00:57:11.366029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.352884Z","title":null,"venue":null,"work_id":"48cbb54f-89d2-4157-9436-5851cfd6d884","year":1999},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.847412Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:bdf4a112a739de451051b5dc5da9b292badd6e903954febc4f23db836fd05faf","observation_id":"08eb1bc9-ba21-4081-938e-685779d06d5d","resolution":{"observed_at":"2026-08-07T00:57:11.356190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.850485Z","title":"Malin, Sricharan Kumar, and Jiaxin Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.850485Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:0e18b2cd2c71d83a3470da00c06c6b92e25dcfc6f4a5757f90928dd76c7771d5","observation_id":"0433ecc0-9904-4509-9613-f476493d1bda","resolution":{"observed_at":"2026-08-07T00:57:10.850485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:57:10.853445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.853445Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:f50c6cc5d6f190116deb69492f239f256f2af687bda697d05290a88c97e5a7f5","observation_id":"f19a296a-b8c6-4db2-a841-9e573f80affb","resolution":{"observed_at":"2026-08-07T00:57:10.853445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.343672Z","title":null,"venue":null,"work_id":"d76f419a-ec1a-4713-ba6d-3dcd4d0c8173","year":2021},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.856654Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:4cfecf38b2524ed761ebd9058e2cb6a83ddf9b468038627cd7d859f6c59adc62","observation_id":"bf334976-5606-46ea-920e-c8115ebb92d4","resolution":{"observed_at":"2026-08-07T00:57:11.346614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T00:57:10.859209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.859209Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:73d21909ce4db668550598891cb5e2eb51bf205b5da9cf2755ed41b6037760d8","observation_id":"7fb5c1bc-f0a8-4ee5-adf9-03af834ef47a","resolution":{"observed_at":"2026-08-07T00:57:10.859209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T00:57:10.862036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.862036Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:c042f282873ae35433580dad0707add28efccb0bb23fc8082753e1564d788335","observation_id":"3c540a06-3b16-476f-90cb-032bd58883f7","resolution":{"observed_at":"2026-08-07T00:57:10.862036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T00:57:10.864820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.864820Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:cca0a442c3671d222e8560d6a6bf94f812f3832aaa470c2092c5e9b7ce14ccd5","observation_id":"766c3ef3-49ac-4d5a-b56d-6f7560111c2d","resolution":{"observed_at":"2026-08-07T00:57:10.864820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03983","last_updated":"2024-10-04T23:52:28Z","snapshot_observed_at":"2026-08-17T01:47:30.573829Z","submitted_at":"2024-10-04T23:52:28Z","title":"MetricX-24: The Google Submission to the WMT 2024 Metrics Shared Task","version":1},"cited_work":{"arxiv_id":"2410.03983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03983","snapshot_observed_at":"2026-08-07T00:57:11.204191Z","title":"MetricX-24: The Google Submission to the WMT 2024 Metrics Shared Task","venue":"cs.CL","work_id":"fc9f7f72-4d67-44e0-9ddd-8558e9fe2a42","year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.867801Z"},"links":{"cited_paper":"/paper/2410.03983","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:5b93cbc6f0cf7c510b89c1557da0952106a90da47273ae3766092a1cd9426ea8","observation_id":"42595550-5a18-4443-a1df-1435d5ba8007","resolution":{"observed_at":"2026-08-07T00:57:11.208030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19884","last_updated":"2024-07-29T11:01:17Z","snapshot_observed_at":"2026-08-16T13:30:17.069122Z","submitted_at":"2024-07-29T11:01:17Z","title":"Preliminary WMT24 Ranking of General MT Systems and LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19884","snapshot_observed_at":"2026-08-07T00:57:10.870910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.870910Z"},"links":{"cited_paper":"/paper/2407.19884","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:33fd1f05ffe7c72eae7517e4c03886fb212b3fde57f8c580f3bb9f548a8b7259","observation_id":"bd23c936-8285-4087-8950-e6fb2c9d78ed","resolution":{"observed_at":"2026-08-07T00:57:10.870910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16745","last_updated":"2024-01-30T04:50:28Z","snapshot_observed_at":"2026-08-16T14:23:23.248848Z","submitted_at":"2024-01-30T04:50:28Z","title":"MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16745","snapshot_observed_at":"2026-08-07T00:57:10.874023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.874023Z"},"links":{"cited_paper":"/paper/2401.16745","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:d8b52b96cefc63e1f652d92e142103c77f8d23031f7ede6317c68ae223025fef","observation_id":"6371c8b8-2223-47bb-ae69-5fa74cfed51e","resolution":{"observed_at":"2026-08-07T00:57:10.874023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.877303Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.877303Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:a9af219d1a8191ac7996c64f04bff1068c1e2b22ac09240349ace3ba8bf45c94","observation_id":"6edf4539-aaf9-4890-85f6-e98b888a3944","resolution":{"observed_at":"2026-08-07T00:57:10.877303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.326949Z","title":null,"venue":null,"work_id":"36912ae6-0c48-43a8-8477-f96ea8ab5d0e","year":2021},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.880538Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:8e46e4aaaabad692520f8e56983eea8a29299678a6cfc5c16b2071af14076b37","observation_id":"f35e663f-0bc7-4a89-8eb9-efd88d9bc290","resolution":{"observed_at":"2026-08-07T00:57:11.330094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14053","last_updated":"2024-02-26T18:56:08Z","snapshot_observed_at":"2026-08-16T14:50:09.025158Z","submitted_at":"2023-10-21T16:14:56Z","title":"Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChain","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14053","snapshot_observed_at":"2026-08-07T00:57:10.885298Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.885298Z"},"links":{"cited_paper":"/paper/2310.14053","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:bf379745af35b964685e35f5754bab18ad1e84903d07a6b71630038010055087","observation_id":"bdd275b8-91d1-4a23-960b-b60932644982","resolution":{"observed_at":"2026-08-07T00:57:10.885298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-07T00:57:10.888528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.888528Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:9840803eb5edaf929594575c15daba07da7cd2a96796a08985d76dec53c9da7a","observation_id":"1acbad04-91ff-47d4-9a66-16e92ff28842","resolution":{"observed_at":"2026-08-07T00:57:10.888528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.316564Z","title":null,"venue":null,"work_id":"5f8a1b99-e95a-464b-92d8-4f20138274ed","year":2002},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.891954Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:cbca82b6078f2ee9660fd5aa773057b922e09211fe768a7865631c516b19b4d3","observation_id":"d6f0a735-8925-4de6-9463-b6d053771fc0","resolution":{"observed_at":"2026-08-07T00:57:11.320159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T00:57:10.895294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.895294Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:08e3eff978b0e84f2332c43a15eb7f1bafbad110b8e06cb109d8eb92165ba0cb","observation_id":"15b82ac5-ab48-4da9-9588-337a88546413","resolution":{"observed_at":"2026-08-07T00:57:10.895294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.898912Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.898912Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:a1d76e19b14d7602d235e10bd5665687ad3b1cbdfb89f8cecd21e17d324d3e7c","observation_id":"0617a9c6-65c8-4ca7-ab18-677fab056174","resolution":{"observed_at":"2026-08-07T00:57:10.898912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11925","last_updated":"2023-09-21T09:38:56Z","snapshot_observed_at":"2026-08-16T14:58:50.909873Z","submitted_at":"2023-09-21T09:38:56Z","title":"Scaling up COMETKIWI: Unbabel-IST 2023 Submission for the Quality Estimation Shared Task","version":1},"cited_work":{"arxiv_id":"2309.11925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11925","snapshot_observed_at":"2026-08-07T00:57:11.051120Z","title":"Scaling up COMETKIWI: Unbabel-IST 2023 Submission for the Quality Estimation Shared Task","venue":"cs.CL","work_id":"ecd259bd-6752-4040-8647-ea3f6dbc3138","year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.901731Z"},"links":{"cited_paper":"/paper/2309.11925","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:646aef04ae125b1e151192d835ad96a5a66956ed8b4bb04815cb08827ab75e97","observation_id":"ca15a532-652c-452d-a539-bbda996e90c4","resolution":{"observed_at":"2026-08-07T00:57:11.055345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.905184Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.905184Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:e03301b42d0a00076b6a2c9fcb4c9fb1e1daf830284443db443402e8436c7e58","observation_id":"b78b934b-c0c5-48e4-a050-5cde0f8bda71","resolution":{"observed_at":"2026-08-07T00:57:10.905184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T00:57:10.908249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.908249Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:cdc69e9536938d52676dd2caf89cdd5b2d98e2e5b919394ce64b9c44276c6707","observation_id":"75ecb9cb-f076-4b2a-86fe-a714d4b318db","resolution":{"observed_at":"2026-08-07T00:57:10.908249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/11941439_149","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":null,"venue":"Lecture notes in computer science","work_id":"28395ea8-b410-4928-b10f-875f93dfd3cb","year":2006},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.912099Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:5790163b28fbee1cb9c19860fe58e49d36c22baa3860f766b21eacb712e58f69","observation_id":"9426f444-e2dd-4eeb-9a11-66b08b1675ca","resolution":{"observed_at":"2026-08-07T00:57:10.963083Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.915097Z","title":"Gomez, ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.915097Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:c45622b668082fe4a275baa1bc95163415adce72972a676125a8b9a8a90a839b","observation_id":"0ebd2b94-b99e-498f-8f9c-f19c1620819a","resolution":{"observed_at":"2026-08-07T00:57:10.915097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T00:57:10.917840Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.917840Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:7511a22a6693e19dad2d02dbb3f7d624af26fd572584835d26f15f9540689695","observation_id":"b2db46cb-b472-4c53-a9af-9c12381f108c","resolution":{"observed_at":"2026-08-07T00:57:10.917840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13640","last_updated":"2025-03-13T16:16:12Z","snapshot_observed_at":"2026-08-16T13:08:22.465297Z","submitted_at":"2024-10-17T15:09:24Z","title":"Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13640","snapshot_observed_at":"2026-08-07T00:57:10.920765Z","title":"Wong, and Rui Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.920765Z"},"links":{"cited_paper":"/paper/2410.13640","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:3fcfd756a89c62c5da3ac5d9f85e882e9dd60f598a92b41433a115ef38e11e0a","observation_id":"e9a8494b-d2f9-47f1-aa87-7a6f86346bc7","resolution":{"observed_at":"2026-08-07T00:57:10.920765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.291632Z","title":null,"venue":null,"work_id":"4d0e639e-223c-431a-953a-779d300e4cca","year":1952},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.923723Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:1ee617d4c217508ba92b310df96907bb0638ecf44aba8a04d928c6135fdae11a","observation_id":"0a388d33-2556-4b29-bc0e-f8fd39ff955e","resolution":{"observed_at":"2026-08-07T00:57:11.295020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11674","last_updated":"2024-02-06T08:03:27Z","snapshot_observed_at":"2026-08-16T14:58:58.078448Z","submitted_at":"2023-09-20T22:53:15Z","title":"A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11674","snapshot_observed_at":"2026-08-07T00:57:10.926390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.926390Z"},"links":{"cited_paper":"/paper/2309.11674","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:f46a7e0a32a50fb64d197ad9438ae2f23e39ea862a1247a513c6bdecc775f548","observation_id":"7262afd5-a0b6-4607-a037-09c8a69a14d0","resolution":{"observed_at":"2026-08-07T00:57:10.926390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-16T13:56:54.401073Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T00:57:10.929888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.929888Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:1f9e5012130630793e03dd077e37dd102ce1e196cc093dd505915a59cf6d6eea","observation_id":"5349fefa-a554-421c-82ef-0da9cf739b54","resolution":{"observed_at":"2026-08-07T00:57:10.929888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06215","last_updated":"2025-02-10T07:33:49Z","snapshot_observed_at":"2026-08-13T19:59:18.728800Z","submitted_at":"2025-02-10T07:33:49Z","title":"LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06215","snapshot_observed_at":"2026-08-07T00:57:10.932988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.932988Z"},"links":{"cited_paper":"/paper/2502.06215","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:5d1273fc553807b26bd74c20139608fc064e9486095cbbe5a823e5ed1efb7348","observation_id":"8c4f554b-11c9-4c03-88a8-301010ae9143","resolution":{"observed_at":"2026-08-07T00:57:10.932988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.12376."}