{"as_of":"2026-08-10T06:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c6a4c28369ab065d910010b31a0d808261260c20e25f85cf26aec69ddcb8e7a","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:36:10.926833Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:59:53.097164Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:25:41.538596Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01793","snapshot_observed_at":"2026-08-07T11:59:53.097164Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-10T05:11:31.269138Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:53.097164Z"},"links":{"cited_paper":"/paper/2506.01793","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:38e2a905f198b8b04c0d48fca96f52cb458bc58486d3b5e90678525fa95016c7","observation_id":"9e614170-5bc0-409a-a2c2-1da423bb0e56","resolution":{"observed_at":"2026-08-07T11:59:53.097164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01793","snapshot_observed_at":"2026-07-01T10:25:41.538596Z","title":"Human-centric evaluation for foundation models","venue":null,"work_id":"ffbc6bce-1643-490f-8ae0-46dad7d2e99d","year":2025},"citing_paper":{"arxiv_id":"2604.18038","last_updated":"2026-04-20T10:02:38Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T10:02:38Z","title":"First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T03:47:54.377400Z"},"links":{"cited_paper":"/paper/2506.01793","citing_paper":"/paper/2604.18038"},"observation_digest":"sha256:5ded67cc849b71ac3895567260e8735d67dc2418b04a97c7c88d0f5f74d9c0b2","observation_id":"6a1415e8-4082-45cf-a4ea-ad53bda88d4d","resolution":{"observed_at":"2026-05-11T12:21:06.094847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01793","snapshot_observed_at":"2026-07-01T10:25:41.538596Z","title":"Human-centric evaluation for foundation models","venue":null,"work_id":"ffbc6bce-1643-490f-8ae0-46dad7d2e99d","year":2025},"citing_paper":{"arxiv_id":"2606.31608","last_updated":"2026-06-30T12:56:42Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:56:42Z","title":"CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-01T05:33:52.027771Z"},"links":{"cited_paper":"/paper/2506.01793","citing_paper":"/paper/2606.31608"},"observation_digest":"sha256:1a9a9415d6a2fbc65a1da7188d1a4df1c4421663c7deaba90e5d4449910aca1f","observation_id":"548330fb-bdcc-40f8-b0eb-a81748eef3eb","resolution":{"observed_at":"2026-07-01T10:25:41.540358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01793/citation-record","integrity":"/paper/2506.01793/integrity","json":"/paper/2506.01793/citation-record.json","paper":"/paper/2506.01793"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-07T11:36:08.031077Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.031077Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:faa256af1920d1b4e0204f2ebc36b07e85d77f9808754b9bf69a2167a9b0c416","observation_id":"0925fa6d-86b5-4107-91d1-39b216dd577b","resolution":{"observed_at":"2026-08-07T11:36:08.031077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.102859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.102859Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:d3595c6877a0dc7d4be4abdc2e7b86f998ffc06046ff46403bf590b16c17ca65","observation_id":"6a0d0b08-ad7f-49d6-b64d-7f052af9b507","resolution":{"observed_at":"2026-08-07T11:36:08.102859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.224321Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.224321Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:45669285c838c09e389211b791bc965c888b65601025eae55531f1512e831e61","observation_id":"10f8423d-b43e-4101-9f64-c10296dc7f76","resolution":{"observed_at":"2026-08-07T11:36:08.224321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.474041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.474041Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:da4a1be73bdfae400830e976157bff47c30efd0ccf1518bf829163d5a2424c32","observation_id":"7cb0088f-27c9-4efb-89af-fd601b966365","resolution":{"observed_at":"2026-08-07T11:36:08.474041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T11:36:08.593518Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.593518Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:75d57ac10934df6438e4f466a689375d94779cab3bea1b075e5503ed861ca38b","observation_id":"cb08326d-a2b4-4860-bddf-5e5d0d273b09","resolution":{"observed_at":"2026-08-07T11:36:08.593518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.706899Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.706899Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:2ef519afc3d990b6b49194ebd784bcc567fec5abc4b20c1e142fadb521b4e73c","observation_id":"c9ef97ce-3767-40b3-b057-acc3948f46e0","resolution":{"observed_at":"2026-08-07T11:36:08.706899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T11:36:08.792029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.792029Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:d3827d638e3859922aa4609e7e69eabb4fbcdd54002aba4295e1867b4cc449ad","observation_id":"42158aae-ee92-4301-92d9-8ff88a539e89","resolution":{"observed_at":"2026-08-07T11:36:08.792029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:12.098822Z","title":null,"venue":null,"work_id":"fb130ce6-bd1a-4993-a053-f7d446dca061","year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.874604Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:7a4f25c60328cf162ec3219969a73e1143b09e25ce494d7362cae2d60d1fafba","observation_id":"8ee8cdb2-dfa9-42af-9b33-144ce5b9461d","resolution":{"observed_at":"2026-08-07T11:36:12.166425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:36:08.961655Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.961655Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:26cb529b8204bfa68ab331286b1400a1958c05db52cd7ac638e0249ddec454ce","observation_id":"a17b21af-4cf2-4fc7-a023-0c07623c5ad2","resolution":{"observed_at":"2026-08-07T11:36:08.961655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T11:36:09.124209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.124209Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:198e3673957177d4f8fe41183eca3ffe70a436038331531888cfe381ab1c82f3","observation_id":"8b0f499c-efa2-4a89-b27c-39659bdb72cf","resolution":{"observed_at":"2026-08-07T11:36:09.124209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:36:09.278576Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.278576Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:00216aa14a9d100ed5192a1ca3997d2dbd3ef1348d14ef0f6d777874698589f0","observation_id":"d97275f3-aeb7-4259-beb4-4f5b339d4c49","resolution":{"observed_at":"2026-08-07T11:36:09.278576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.935515Z","title":null,"venue":null,"work_id":"eeb8f856-e89c-4d8a-8380-df8c935224b7","year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.435590Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:8e6378ad539078cc9001673f50863efe08f96563d360dc6bb5a8ff804663347f","observation_id":"5b1ff2b2-0971-427a-8e64-d414fca976d8","resolution":{"observed_at":"2026-08-07T11:36:12.015503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T11:36:09.544344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.544344Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:5d12755d5c317a492bae54699b68b35e05b01d23ffed36e54af31f8ae3e7ea3f","observation_id":"25ade072-4507-4075-b16b-4c97191acf3a","resolution":{"observed_at":"2026-08-07T11:36:09.544344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:09.708758Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.708758Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:cd4aa0e628c512aaf0f44c86fb620dc95408fe0f85b71243282bfac7da979683","observation_id":"151c695c-ddd2-49fe-9a92-79b3978cd901","resolution":{"observed_at":"2026-08-07T11:36:09.708758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07545","last_updated":"2024-06-11T17:59:47Z","snapshot_observed_at":"2026-08-09T04:16:29.111894Z","submitted_at":"2024-06-11T17:59:47Z","title":"Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07545","snapshot_observed_at":"2026-08-07T11:36:10.030772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.030772Z"},"links":{"cited_paper":"/paper/2406.07545","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:edefc21dbe35e82cae9cef63bf850df082407cb436925eace8404acda1896cd6","observation_id":"d031f4f1-005b-4baf-8be1-021ff3e3a4fa","resolution":{"observed_at":"2026-08-07T11:36:10.030772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.734592Z","title":null,"venue":null,"work_id":"147b2098-f3af-45de-b124-300b2d41ec54","year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.154302Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:e060551974c32d4a6624330ec025a583ccf67915814628f198bb51ccf8916d73","observation_id":"919e515e-177e-4bd9-aeb6-75efb7ded9e5","resolution":{"observed_at":"2026-08-07T11:36:11.856502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T11:36:10.296684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.296684Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:e3b12023885163165ae9165cfdf916dfc30b89319eb2295908381c92c545b987","observation_id":"260f860c-a932-449e-8e9a-da62a1004ff0","resolution":{"observed_at":"2026-08-07T11:36:10.296684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:10.369987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.369987Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:642bb3a48aabbd8aaa790c5867d2eea89d6af6246d26cfb0df3cec4ceb2cff91","observation_id":"b1bfe8b1-1829-4482-91fa-ee62fedbcd31","resolution":{"observed_at":"2026-08-07T11:36:10.369987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:10.453562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.453562Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:fccfdd83c73bc9ecfd3d6dbacc57944a2dc286d890d79b3db2bf06612c24909c","observation_id":"0c8d298b-56b9-4d13-bb50-b23deab3d747","resolution":{"observed_at":"2026-08-07T11:36:10.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T11:36:10.624298Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.624298Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:6d086b1d0b2b61cd4ac2525cd2613279b27a16f6cbaceb6aec2c4ff325f4b171","observation_id":"12fd8df5-1cc1-44d1-8fb9-895e0f64c910","resolution":{"observed_at":"2026-08-07T11:36:10.624298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.299881Z","title":null,"venue":null,"work_id":"c1145e66-d149-4d8b-959a-1a73bb73d392","year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.706120Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:096d94d6ee1a6be9fee38a1cea65b2623124e2619de8e995fc612322b611656e","observation_id":"34896e7b-0bd2-4806-bb20-04bc90db23c2","resolution":{"observed_at":"2026-08-07T11:36:11.406036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:36:10.812719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.812719Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:2c863b95f4ddab8ca870ba6e0c3a876abc8eb48e8bc6cde701fa740116d64612","observation_id":"e1633281-b1ea-4bbf-b403-de3c5dbe2028","resolution":{"observed_at":"2026-08-07T11:36:10.812719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.132580Z","title":null,"venue":null,"work_id":"dc019316-fdc2-405b-a7d0-70bfc0fcaebc","year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.926833Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:2dd7c91b4708825ff5fe316fa85a625799cb7a0566f4784a2126169b5996c624","observation_id":"6efeae68-bae3-4bbb-98a0-2fe772516df6","resolution":{"observed_at":"2026-08-07T11:36:11.186918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-07-06T11:43:15.244747Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-07T11:36:08.350199Z","title":"arXiv preprint arXiv:2109.00122 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.350199Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:27b9cff3300196312ef3473d9fc70c582518d9f02a139d2b15cf94fd08989588","observation_id":"dd24c201-aef2-4daa-9cec-1c0213776a6f","resolution":{"observed_at":"2026-08-07T11:36:08.350199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:36:09.881359Z","title":"arXiv preprint arXiv:2211.09110 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.881359Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:f5f1744aa9cbc512178805725bc77379e66c70a0ade9b60c4e039e67e431cd7a","observation_id":"fcb0f193-1d3f-4d51-bf99-f699c382f548","resolution":{"observed_at":"2026-08-07T11:36:09.881359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.519067Z","title":"Nature Machine Intelligence 5, 1 (2023), 46–57","venue":null,"work_id":"95220aea-1c57-4fe3-b760-b6101a821b49","year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.530656Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:1648818ac424112121856d184e7b1f3f798c96640d734f1a4aab377387fce5ba","observation_id":"b7d07220-01ed-4edf-855e-d4ed56d2bb6a","resolution":{"observed_at":"2026-08-07T11:36:11.617747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 3 inbound Pith citation observations for arXiv:2506.01793."}