{"as_of":"2026-08-14T01:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f34dbbae03966939dc6a764b36b2d034282abdbbe884429dd79d09e219abcec","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:53:29.689406Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:16.726294Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:56:25.216379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-08-07T14:01:16.726294Z","title":"Financeqa: A benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20246","last_updated":"2025-06-19T15:42:45Z","snapshot_observed_at":"2026-08-12T19:06:18.070702Z","submitted_at":"2025-05-26T17:22:20Z","title":"On Path to Multimodal Historical Reasoning: HistBench and HistAgent","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:16.726294Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2505.20246"},"observation_digest":"sha256:0454c03eba661c7e88514e9a184de04c857324c754da2965c9a6bc08ae69a971","observation_id":"b5cbb368-61f5-41b7-a401-2147d79c0faa","resolution":{"observed_at":"2026-08-07T14:01:16.726294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-08-11T13:25:57.999910Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:59:59.383781Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2604.06132"},"observation_digest":"sha256:aa47aab091e3df1c8411385d2e48bfd7c0a94d0363912d9f858591df260e90c7","observation_id":"2fbc8455-1593-4cd7-8fff-6dce4cc607e4","resolution":{"observed_at":"2026-05-10T23:35:51.605474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2604.17305","last_updated":"2026-04-19T07:42:07Z","snapshot_observed_at":"2026-08-13T04:47:14.716458Z","submitted_at":"2026-04-19T07:42:07Z","title":"BizCompass: Benchmarking the Reasoning Capabilities of LLMs in Business Knowledge and Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:52:40.026883Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2604.17305"},"observation_digest":"sha256:05a91ddd4eae35cc7080910ea18612cbfc07ad11c8bf84f708fb3118bcba88f5","observation_id":"12905610-f501-471c-8f08-6dbd8eade104","resolution":{"observed_at":"2026-05-10T05:56:11.234156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2604.26235","last_updated":"2026-04-29T02:32:14Z","snapshot_observed_at":"2026-08-12T14:59:14.513630Z","submitted_at":"2026-04-29T02:32:14Z","title":"LATTICE: Evaluating Decision Support Utility of Crypto Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T13:30:46.523784Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2604.26235"},"observation_digest":"sha256:37132dac381112c8607a3088c8e4f76d64e7565e61de3f5d30650b122ade8026","observation_id":"13123e87-942a-4f52-a066-c3c8fae96dff","resolution":{"observed_at":"2026-05-12T08:56:25.221197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2605.09106","last_updated":"2026-05-09T18:28:40Z","snapshot_observed_at":"2026-08-02T14:28:15.824774Z","submitted_at":"2026-05-09T18:28:40Z","title":"Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T02:15:53.024591Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2605.09106"},"observation_digest":"sha256:9a09540ccf5e487ccb733ab85c206f608d58460710637b0c3a8cb36431c8c72d","observation_id":"63f6b8a0-ee55-448e-b67a-77b42fa61a60","resolution":{"observed_at":"2026-05-12T02:16:15.789703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18062/citation-record","integrity":"/paper/2501.18062/integrity","json":"/paper/2501.18062/citation-record.json","paper":"/paper/2501.18062"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-08-13T20:15:19.894749Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-10T00:53:29.668745Z","title":"& Wang, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.668745Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:b70f3af468849128065cd47dc0e641bc1e27c6a4bfadf19162d3d0eb94a951b8","observation_id":"e72439a9-86fe-476f-aab3-5a609cab0709","resolution":{"observed_at":"2026-08-10T00:53:29.668745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-08-13T18:35:52.271946Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-10T00:53:29.678903Z","title":"arXiv preprint arXiv:2311.11944 Koller, T., Goedhart, M., & Wessels, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.678903Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:904e51dd0ff8f15d8c5066e431d0dd4104d5db24db694817e895e4d0ee49b9f4","observation_id":"474df27b-e50d-4e34-bc2a-f91db76556c0","resolution":{"observed_at":"2026-08-10T00:53:29.678903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-08-13T00:15:47.844263Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-08-10T00:53:29.689406Z","title":"Materiality","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.689406Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:a2a5240f47494d0da115e247909fbfaf4dde12f237be3be77f438ef4610a1bf4","observation_id":"2a1c8f9d-32ed-492d-a6d9-ba31d633346c","resolution":{"observed_at":"2026-08-10T00:53:29.689406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11462","last_updated":"2023-08-20T22:08:03Z","snapshot_observed_at":"2026-08-13T10:30:49.589624Z","submitted_at":"2023-08-20T22:08:03Z","title":"LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11462","snapshot_observed_at":"2026-08-10T00:53:29.674023Z","title":"arXiv preprint arXiv:2308.11462","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.674023Z"},"links":{"cited_paper":"/paper/2308.11462","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:e7f89cc1bbc83f1d29941cd0f82452b957f92095d55c5c8804a7faa121877edf","observation_id":"8a430616-9e27-4c79-a038-68fdfff5f118","resolution":{"observed_at":"2026-08-10T00:53:29.674023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07565","last_updated":"2024-10-03T16:48:55Z","snapshot_observed_at":"2026-08-12T23:25:07.570083Z","submitted_at":"2024-07-10T11:50:20Z","title":"On Leakage of Code Generation Evaluation Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07565","snapshot_observed_at":"2026-08-10T00:53:29.683526Z","title":"arXiv preprint arXiv:2407.07565","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.683526Z"},"links":{"cited_paper":"/paper/2407.07565","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:8b860a2d82662ccde46b9d59dbd88575f1076037ef724116610751fe747db7ed","observation_id":"7a0ac1f2-210a-47c6-9806-17bf56a4be43","resolution":{"observed_at":"2026-08-10T00:53:29.683526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 5 of 5 outbound references and 5 inbound Pith citation observations for arXiv:2501.18062."}