{"as_of":"2026-08-21T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61e660900a6a3488f9e0821deeede4138fe50e640a3da543526dd2909483f3e8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:34:42.280569Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:36:27.452622Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-12T15:29:32.632423Z","title":"Jungo Kasai, Keisuke Sakaguchi, Yoichi Takahashi, Ronan Le Bras, Akari Asai, Xinyan Yu, Dragomir Radev, Noah A Smith, Yejin Choi, and Kentaro Inui","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14199","last_updated":"2024-11-21T15:07:42Z","snapshot_observed_at":"2026-08-19T08:30:46.152139Z","submitted_at":"2024-11-21T15:07:42Z","title":"OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMs","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T15:29:32.632423Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2411.14199"},"observation_digest":"sha256:8f74e1e6f3d8fabdcda21a5810f2e4fe5948507fbd68305d6652f04eb4a87a99","observation_id":"3f67dbd6-a5e2-4f4f-9e15-6e82d5d3ef93","resolution":{"observed_at":"2026-08-12T15:29:32.632423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-11T16:54:52.920460Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12175","last_updated":"2024-12-12T21:29:00Z","snapshot_observed_at":"2026-08-16T12:39:37.628376Z","submitted_at":"2024-12-12T21:29:00Z","title":"Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:54:52.920460Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2412.12175"},"observation_digest":"sha256:882e66af19e6f70672f576a4f6d3ca43fc3680db366d2fba9802f4531925baba","observation_id":"14d1d0cc-b665-4a4b-b844-73eec63fc032","resolution":{"observed_at":"2026-08-11T16:54:52.920460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-11T12:32:23.877682Z","title":"In The Twelfth Inter- national Conference on Learning Representations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14140","last_updated":"2024-12-20T21:59:56Z","snapshot_observed_at":"2026-08-15T16:14:36.378413Z","submitted_at":"2024-12-18T18:41:12Z","title":"GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T12:32:23.877682Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2412.14140"},"observation_digest":"sha256:3cd6399db601b6853a7d647cd2cd299fd523127d8fe0b937275e74a5b977d0dd","observation_id":"d0960f4e-fff1-46d6-96c4-885849d85175","resolution":{"observed_at":"2026-08-11T12:32:23.877682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-08T11:15:44.981245Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07985","last_updated":"2025-04-07T09:15:30Z","snapshot_observed_at":"2026-08-18T13:27:55.091611Z","submitted_at":"2025-02-11T22:06:25Z","title":"MetaSC: Test-Time Safety Specification Optimization for Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T11:15:44.981245Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2502.07985"},"observation_digest":"sha256:c7f76b5ecc1f75dc43cbb4215ca5758cbce61e6c6dbc7b47dffe1c6ddc197ba2","observation_id":"edf4a044-44f1-432b-a217-65ca0d19f1f8","resolution":{"observed_at":"2026-08-08T11:15:44.981245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-08T04:58:32.668823Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08489","last_updated":"2025-02-13T17:33:24Z","snapshot_observed_at":"2026-08-13T23:11:01.152432Z","submitted_at":"2025-02-12T15:26:08Z","title":"Salamandra Technical Report","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T04:58:32.668823Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2502.08489"},"observation_digest":"sha256:5880a1991890afa2e426c93361e8c87312432bda4791124007b43c641f31b053","observation_id":"1f62dacc-111b-4c33-981d-f83a21f7aca7","resolution":{"observed_at":"2026-08-08T04:58:32.668823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-16T11:34:42.280569Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.280569Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:d5ac2221c93f17fc52dab63442fae66c22c5ac2052f042ceaf3ffc5e4cd55889","observation_id":"52971542-9699-47ac-9a56-320483853afa","resolution":{"observed_at":"2026-08-16T11:34:42.280569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-16T11:32:05.941324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15431","last_updated":"2025-04-21T20:54:44Z","snapshot_observed_at":"2026-08-16T11:24:41.443927Z","submitted_at":"2025-04-21T20:54:44Z","title":"Trillion 7B Technical Report","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:05.941324Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2504.15431"},"observation_digest":"sha256:1f30f667cc87862ee91bcc78db553217263c4443d50d65ea1324560a2d12cc26","observation_id":"022857c0-015a-464c-bfbd-d7c1624d3580","resolution":{"observed_at":"2026-08-16T11:32:05.941324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-15T20:32:25.241466Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models.arXiv preprint arXiv:2406.05761, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12808","last_updated":"2025-05-19T07:34:25Z","snapshot_observed_at":"2026-08-19T00:12:06.194808Z","submitted_at":"2025-05-19T07:34:25Z","title":"Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:25.241466Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2505.12808"},"observation_digest":"sha256:c7a72fa1f6f9027694077ad9db235045dba37856a28d0bf495ab09104d26ece1","observation_id":"67ce7fc7-be5d-400a-9375-59c2bb7de809","resolution":{"observed_at":"2026-08-15T20:32:25.241466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-07T11:04:07.036636Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.036636Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:8e4d0ec7cfc80749826eb9b61cef5c3fb1b147ae0cdcdee1c6d9e920bd62849b","observation_id":"9bcc8e31-95e2-4215-9e50-b123a60c7ee0","resolution":{"observed_at":"2026-08-07T11:04:07.036636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-07T10:50:52.001931Z","title":"InThe Twelfth Inter- national Conference on Learning Representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04463","last_updated":"2025-06-04T21:29:11Z","snapshot_observed_at":"2026-08-14T12:28:02.149123Z","submitted_at":"2025-06-04T21:29:11Z","title":"Aligning Large Language Models with Implicit Preferences from User-Generated Content","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.001931Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2506.04463"},"observation_digest":"sha256:119e7f2d6fa3c06c5ac8ef007d74013c4fd5ae9eff962c371673c60c8ef81432","observation_id":"2f7fa853-9edd-4b9b-b9f2-82d2ba362b9c","resolution":{"observed_at":"2026-08-07T10:50:52.001931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-07T00:31:35.564117Z","title":"Klaus Krippendorff","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13639","last_updated":"2025-06-16T16:04:43Z","snapshot_observed_at":"2026-08-16T19:16:57.442306Z","submitted_at":"2025-06-16T16:04:43Z","title":"An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.564117Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2506.13639"},"observation_digest":"sha256:ed241358ceb62c809f7849839b835bac0cbbd83cfe18dbb149e2388de2ffa67d","observation_id":"840b7fc9-1e0e-4dcc-99f5-49bfd2af4791","resolution":{"observed_at":"2026-08-07T00:31:35.564117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":"2406.05761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-07-02T02:36:27.452622Z","title":"Y., et al","venue":null,"work_id":"ea7cc881-eb36-4c10-ac78-d0f89fe9dd4d","year":2025},"citing_paper":{"arxiv_id":"2509.11206","last_updated":"2026-04-20T05:43:30Z","snapshot_observed_at":"2026-08-15T19:32:23.981635Z","submitted_at":"2025-09-14T10:24:13Z","title":"Evalet: Evaluating Large Language Models through Functional Fragmentation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T16:57:25.259866Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2509.11206"},"observation_digest":"sha256:23fb8971ba74f01e2f9920447aa767aa54e200c085ac933f34686456b3c2ca9d","observation_id":"7d636483-3ae0-4150-890f-df653d0b1174","resolution":{"observed_at":"2026-05-18T17:01:40.061056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":"2406.05761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-07-02T02:36:27.452622Z","title":"Y., et al","venue":null,"work_id":"ea7cc881-eb36-4c10-ac78-d0f89fe9dd4d","year":2025},"citing_paper":{"arxiv_id":"2605.25603","last_updated":"2026-05-25T08:54:55Z","snapshot_observed_at":"2026-08-10T09:24:29.678831Z","submitted_at":"2026-05-25T08:54:55Z","title":"Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T21:47:17.894881Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2605.25603"},"observation_digest":"sha256:7621661cead89964250523a192d7c42c0fc0ad4229331ea1a02d10ccae1bf9a7","observation_id":"d9e87539-1a81-450a-b433-0784c542ef95","resolution":{"observed_at":"2026-06-29T21:53:59.562279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":"2406.05761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-07-02T02:36:27.452622Z","title":"Y., et al","venue":null,"work_id":"ea7cc881-eb36-4c10-ac78-d0f89fe9dd4d","year":2025},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-11T09:05:16.100158Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:40796c8941f859e9f249aae7df260afa8a0969a8defbafd89e56ecf7773362db","observation_id":"d42c853c-44aa-4875-99eb-f390e9b72887","resolution":{"observed_at":"2026-07-02T02:36:27.454057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-08T18:53:02.007620Z","title":"arXiv preprint arXiv:2406.05761 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04374","last_updated":"2026-08-05T02:31:48Z","snapshot_observed_at":"2026-08-18T17:13:25.641192Z","submitted_at":"2026-08-05T02:31:48Z","title":"FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T18:53:02.007620Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2608.04374"},"observation_digest":"sha256:1c66558df80b4f43577d757506b59dfcd144ec3d53d547c679d834f162d9ce03","observation_id":"acad77c1-3bac-4ea6-ac20-e78029278a30","resolution":{"observed_at":"2026-08-08T18:53:02.007620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.05761/citation-record","integrity":"/paper/2406.05761/integrity","json":"/paper/2406.05761/citation-record.json","paper":"/paper/2406.05761"},"outbound":[],"paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T05:43:17.336704Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2406.05761."}