{"as_of":"2026-08-08T13:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb6a3fdc6381ca392d3e4d571c1af6cdd01c65e6b7e8067730e97a9d59f13a6f","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:04.057694Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:18:45.189576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:05:46.699261Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.18421","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18421","snapshot_observed_at":"2026-07-22T00:22:12.404705Z","title":null,"venue":null,"work_id":"d0d5cabb-699a-457c-8ae7-19aa8501e94d","year":2025},"citing_paper":{"arxiv_id":"2605.12376","last_updated":"2026-06-04T17:58:18Z","snapshot_observed_at":"2026-08-07T20:29:26.287618Z","submitted_at":"2026-05-12T16:42:38Z","title":"ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:56:36.312877Z"},"links":{"cited_paper":"/paper/2506.18421","citing_paper":"/paper/2605.12376"},"observation_digest":"sha256:fd9cf7b0f32147337274b3a4917036026973bb26aeb240617977010db44d1d57","observation_id":"014cfda9-bca4-4b8a-98b3-9f9f3905be6e","resolution":{"observed_at":"2026-07-22T00:22:12.404705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.18421","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18421","snapshot_observed_at":"2026-07-22T00:22:12.404705Z","title":null,"venue":null,"work_id":"d0d5cabb-699a-457c-8ae7-19aa8501e94d","year":2025},"citing_paper":{"arxiv_id":"2605.12376","last_updated":"2026-06-04T17:58:18Z","snapshot_observed_at":"2026-08-07T20:29:26.287618Z","submitted_at":"2026-05-12T16:42:38Z","title":"ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:45.189576Z"},"links":{"cited_paper":"/paper/2506.18421","citing_paper":"/paper/2605.12376"},"observation_digest":"sha256:4947dfcf9feacc41d1bdc5e7bb10ca65dd037246359103f90f05d684c3bf5576","observation_id":"5dad171a-f708-44a9-9e65-1a3ab37af9d1","resolution":{"observed_at":"2026-07-22T00:22:12.404705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18421/citation-record","integrity":"/paper/2506.18421/integrity","json":"/paper/2506.18421/citation-record.json","paper":"/paper/2506.18421"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:20:00.709832Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.709832Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:40974b79427fb77cc41864d49c709ea5f527cd9474948076c1fcf36c664fee76","observation_id":"4b3a2a05-58ce-4e41-97c9-b4b49af9becd","resolution":{"observed_at":"2026-08-06T23:20:00.709832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-06T23:20:01.001340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.001340Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:cc1606022a0cbf7051f8ae0464b9b496abe30d6c16f6faa31d4a31f0441a5945","observation_id":"338be5f1-e943-4a6f-8e59-060ada6d38a0","resolution":{"observed_at":"2026-08-06T23:20:01.001340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.363864Z","title":"R., et al","venue":null,"work_id":"c9f909cf-ed92-4811-9816-dd83f3ad22e6","year":2021},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.051627Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:390e36d5435237a566ff61627fd0b8b59d7d28d8b0aa50f8a57756b82c7a3d9b","observation_id":"f5a0899b-0996-452e-a24a-0004dc95ce6a","resolution":{"observed_at":"2026-08-06T23:20:05.462141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:20:01.103215Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.103215Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:e7c09954f3ca6afeaa830297cf83e4611bf84588ca1e14421af0ddfd197982f8","observation_id":"4744b0a9-e1cc-423d-be1d-4ab347163d09","resolution":{"observed_at":"2026-08-06T23:20:01.103215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-06T23:20:01.350485Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.350485Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:35dbd874824c29fe4602a3d0ea6aefe88bf7d215c75cac5215ace49f08b2688e","observation_id":"37bf6e34-0550-4b47-9a1c-d55322eeacbc","resolution":{"observed_at":"2026-08-06T23:20:01.350485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:20:01.408209Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.408209Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:a71ab3b2f225052ed27ea7ed62c948f21fc2e5ff56721f44bb88dec8fd77d5e0","observation_id":"da391928-f427-42e1-b027-8a07c6e7404f","resolution":{"observed_at":"2026-08-06T23:20:01.408209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T23:20:01.489710Z","title":"A survey on llm-as-a- judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.489710Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:cbfa2f4943884ce3a4a16bdb8b3f26488906f0406aa3e7d5627c5dcff5a5a840","observation_id":"27e5dc92-2636-4092-8a11-e867b2856365","resolution":{"observed_at":"2026-08-06T23:20:01.489710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T23:20:01.630884Z","title":"K., Luo, F., Xiong, Y ., and Liang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.630884Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:4355dbe729f20856da5b982e69b4d12cfab6d179db036a70b8497e07354ad610","observation_id":"8735e25e-e6f3-4e3b-9d82-d8a27040ef97","resolution":{"observed_at":"2026-08-06T23:20:01.630884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T23:20:01.729656Z","title":"Measuring math- ematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.729656Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:af6afd149b98c37b9e45a1983b7669e33ca3e8f47a1526631050a3ed52307818","observation_id":"28ca5b0e-bb76-4375-bb69-a5af0144a6fe","resolution":{"observed_at":"2026-08-06T23:20:01.729656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T23:20:01.826117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.826117Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:87847f5d2a403d77cfbf9295af4ac6a10c1a153aa518bd48a8522e817ad9a403","observation_id":"d4799446-eba0-46b9-abc3-7b18fee89f36","resolution":{"observed_at":"2026-08-06T23:20:01.826117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09829","last_updated":"2023-11-16T11:53:31Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T11:53:31Z","title":"FollowEval: A Multi-Dimensional Benchmark for Assessing the Instruction-Following Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09829","snapshot_observed_at":"2026-08-06T23:20:02.097569Z","title":"Followeval: A multi-dimensional bench- mark for assessing the instruction-following capability of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.097569Z"},"links":{"cited_paper":"/paper/2311.09829","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:e8a73b16cfa1d05e5e20298fb099c274dfe3ea21208ab23da1b33b498a3bb15c","observation_id":"80cd3bb1-90be-4ef7-bb44-8c12aa87e8be","resolution":{"observed_at":"2026-08-06T23:20:02.097569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.046722Z","title":"Ait-qa: Question answering dataset over complex tables in the airline industry","venue":null,"work_id":"2e726076-8e23-453d-ac1e-d73b131f254b","year":2022},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.229374Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:1fac4d7a5dd8c1a9696e01dede9a069bd2e9aaa72708fbdbefdbe9e6159479d6","observation_id":"8d00a86d-a6ac-4f38-ac47-b5ce33ac0601","resolution":{"observed_at":"2026-08-06T23:20:05.113736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-08-08T00:41:39.718003Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-08-06T23:20:02.470277Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.470277Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:ff6b14d5c6f195e95aa75e5d66583d375f37097235ab7ddb209effe48c3b250c","observation_id":"12d33cae-f6e2-4ee8-8fb0-29985d374f4c","resolution":{"observed_at":"2026-08-06T23:20:02.470277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15075","last_updated":"2023-10-23T16:33:23Z","snapshot_observed_at":"2026-08-02T13:21:27.581593Z","submitted_at":"2023-10-23T16:33:23Z","title":"TableQAKit: A Comprehensive and Practical Toolkit for Table-based Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15075","snapshot_observed_at":"2026-08-06T23:20:02.598781Z","title":"Tableqakit: a com- prehensive and practical toolkit for table-based question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.598781Z"},"links":{"cited_paper":"/paper/2310.15075","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:b504e37b718df0fc15fbfb8e70c4bf8b0bb86963893b5eedf3958f7f79112e85","observation_id":"d897cdce-52af-46b2-ac59-5c62e1a1d68f","resolution":{"observed_at":"2026-08-06T23:20:02.598781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15296","last_updated":"2024-05-24T03:29:14Z","snapshot_observed_at":"2026-07-06T16:52:27.457437Z","submitted_at":"2023-11-26T13:42:56Z","title":"UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation","version":3},"cited_work":{"arxiv_id":"2311.15296","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15296","snapshot_observed_at":"2026-08-06T23:20:04.338594Z","title":"UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation","venue":"cs.CL","work_id":"35152e2e-0b2d-4920-9b91-1b139d8f84da","year":2023},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.713992Z"},"links":{"cited_paper":"/paper/2311.15296","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:7c9fe4b64e5b9b4a9bd669f750e7a49cdb233918a4f55e98c99e17442025874a","observation_id":"fa4b1cff-1354-4f94-a1b6-c2ffd55a2a6d","resolution":{"observed_at":"2026-08-06T23:20:04.474776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:20:03.205192Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.205192Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:edfd28f28ba3995754d07c4d73727a2236ad5622d106f0dc5a9c2a5a2432b823","observation_id":"86b4b131-021c-4617-80dd-67208fb4602b","resolution":{"observed_at":"2026-08-06T23:20:03.205192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02059","last_updated":"2024-11-07T03:32:44Z","snapshot_observed_at":"2026-08-07T15:32:17.369903Z","submitted_at":"2024-11-04T13:03:13Z","title":"TableGPT2: A Large Multimodal Model with Tabular Data Integration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02059","snapshot_observed_at":"2026-08-06T23:20:03.333517Z","title":"Tablegpt2: A large multimodal model with tabular data integration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.333517Z"},"links":{"cited_paper":"/paper/2411.02059","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:126c4fc5982aba9205a9c25cecbfbf68c310db4316fda36f62a776aac90201ba","observation_id":"bdf2d175-1d2b-4802-868a-b97e70998156","resolution":{"observed_at":"2026-08-06T23:20:03.333517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T23:20:03.461424Z","title":"H., and Li, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.461424Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:7467e20936e847f63563c96462ce2b155aa6e041cee339110f7eddfcdcc945c3","observation_id":"6f6c6654-9fed-443f-8b78-24f80ffffc80","resolution":{"observed_at":"2026-08-06T23:20:03.461424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11242","last_updated":"2025-03-18T02:12:21Z","snapshot_observed_at":"2026-07-06T17:04:37.751364Z","submitted_at":"2023-12-18T14:40:20Z","title":"MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11242","snapshot_observed_at":"2026-08-06T23:20:03.588865Z","title":"Mac-sql: A multi-agent collaborative framework for text-to-sql.arXiv preprint arXiv:2312.11242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.588865Z"},"links":{"cited_paper":"/paper/2312.11242","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:d4301f7f28e4522bfe3c9f6e8710ed7ce19e27933aecb0437875fd02ec39c406","observation_id":"30c8885d-9fdf-40f1-b468-994f82b39700","resolution":{"observed_at":"2026-08-06T23:20:03.588865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11354","last_updated":"2025-04-15T16:23:44Z","snapshot_observed_at":"2026-08-03T03:38:06.953412Z","submitted_at":"2025-04-15T16:23:44Z","title":"Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11354","snapshot_observed_at":"2026-08-06T23:20:03.663026Z","title":"D., Sung, F., Vinyes, M., Ying, Z., Zhu, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.663026Z"},"links":{"cited_paper":"/paper/2504.11354","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:a8b8ebeb9d24dd5be1e99647eea7a90f2fc38aad493b7e6e16b34452961fe03d","observation_id":"c82b98e5-bc45-4474-9226-1faf9aee2f94","resolution":{"observed_at":"2026-08-06T23:20:03.663026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:20:03.756297Z","title":"Mmqa: Evaluating llms with multi-table multi-hop complex questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.756297Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:3186d07cf26a4435a9a680e2fabdbc26cd3b817a185b134cd603f0d0f046a4c4","observation_id":"b8ee7cea-3bc6-4461-85a4-b7c960ad444e","resolution":{"observed_at":"2026-08-06T23:20:03.756297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T23:20:03.872378Z","title":"arXiv preprint arXiv:2403.04652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.872378Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:a8db2cb5d8f74a2e5682f820eb7a004cca4a4090c05990d82c1bbd512a97a8aa","observation_id":"d44e477d-a053-445e-b0d9-c49b8f7aa476","resolution":{"observed_at":"2026-08-06T23:20:03.872378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:04.701121Z","title":"Spider: A large-scale human-labeled dataset for complex and cross- domain semantic parsing and text-to-sql task","venue":null,"work_id":"2e6fb93d-fc26-4d5c-81bb-2baae9ce0504","year":2018},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.958511Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:d7abd627283b40323c25b464682179c3c766edff9c2212740b98f53bb53ca6cf","observation_id":"5424cf12-9e9c-4ac5-996c-feb3e76872a5","resolution":{"observed_at":"2026-08-06T23:20:04.802096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-06T23:20:04.057694Z","title":"Y ., Vu, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:04.057694Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:38309b0754db1c6bc2646da89ce371d9f98123d07cd053d178c1a66bf019e389","observation_id":"409a6220-26df-4c16-b46e-06bbdf72dbe6","resolution":{"observed_at":"2026-08-06T23:20:04.057694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:04.896260Z","title":"Totto: A controlled table- to-text generation dataset","venue":null,"work_id":"63933e7a-b311-4672-b4c2-6725fb1ab0ff","year":2020},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.940097Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:da737e9424b8eedb7baa9d079fa7c5ec227917953d7f105f9e902c51e4a8315f","observation_id":"85074de9-9cc1-4f2f-a4cd-dd4e197a6f2a","resolution":{"observed_at":"2026-08-06T23:20:04.964808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12209","last_updated":"2024-05-20T17:52:29Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:52:29Z","title":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12209","snapshot_observed_at":"2026-08-06T23:20:02.838439Z","title":"Math- bench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark.arXiv preprint arXiv:2405.12209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.838439Z"},"links":{"cited_paper":"/paper/2405.12209","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:135464d63ac2dec001da3ab66c75f6864ab4612d3f80563424239c348616029c","observation_id":"193dd8cc-9d80-4f51-8211-c7db35f3a691","resolution":{"observed_at":"2026-08-06T23:20:02.838439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19504","last_updated":"2026-06-05T23:48:53Z","snapshot_observed_at":"2026-07-06T19:58:48.586415Z","submitted_at":"2024-11-29T06:48:13Z","title":"TQA-Bench: Evaluating LLMs for Multi-Table Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19504","snapshot_observed_at":"2026-08-06T23:20:03.071359Z","title":"Tqa-bench: Evaluating llms for multi-table question answering with scalable context and symbolic extension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.071359Z"},"links":{"cited_paper":"/paper/2411.19504","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:9df7240b87106a13d977ee190bd897f7ce6332c9646213950e3e40b63f3c6ec8","observation_id":"111542bc-8bb5-4529-a60e-5f500ef79af2","resolution":{"observed_at":"2026-08-06T23:20:03.071359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T23:20:01.965467Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.965467Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:3c5af3c18cf5564087b7e30bd35beb24079e220046be46ade245e0df87cca37b","observation_id":"f7b13eb3-f7c8-4ef6-aa61-1394f2fbae1f","resolution":{"observed_at":"2026-08-06T23:20:01.965467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07436","last_updated":"2024-06-11T16:45:17Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:45:17Z","title":"McEval: Massively Multilingual Code Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07436","snapshot_observed_at":"2026-08-06T23:20:00.861149Z","title":"Mceval: Massively multilingual code evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.861149Z"},"links":{"cited_paper":"/paper/2406.07436","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:a2aa84b0f9821e874ff3e6a4e6da22492fc1fc35cdd25d448ce74fe09b670d57","observation_id":"0f7daa07-7220-4925-a7c1-5faf4bcceee0","resolution":{"observed_at":"2026-08-06T23:20:00.861149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:20:01.190008Z","title":"Deepseek-r1: Incentivizing reasoning capa- bility in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.190008Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:284f07154464c457e3048050d1a5da14f540fdaecdd8ac60a0c75a4dc60dc9bc","observation_id":"bf0866df-e83f-417e-ba0d-bdbccb941bb4","resolution":{"observed_at":"2026-08-06T23:20:01.190008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14415","last_updated":"2025-06-30T15:48:16Z","snapshot_observed_at":"2026-08-08T04:19:16.139935Z","submitted_at":"2025-05-20T14:27:51Z","title":"Table Foundation Models: on knowledge pre-training for tabular learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14415","snapshot_observed_at":"2026-08-06T23:20:02.370073Z","title":"J., Lefebvre, F., Brison, G., Perez-Lebel, A., and Varoquaux, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:02.370073Z"},"links":{"cited_paper":"/paper/2505.14415","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:3d7c9ce3749c53daf8338abe6340effebad78a414c7cff1ee2b35393ce566a40","observation_id":"48d2a58e-7701-44fd-a6bd-4891431660d6","resolution":{"observed_at":"2026-08-06T23:20:02.370073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:00.771769Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.771769Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:92c8b97a5a79b95b31e65a486d25b9d2e53eba25d234ccf1347b1361f0096cf8","observation_id":"1d4d8fcb-ca5b-4c36-b977-d8630df5f8ee","resolution":{"observed_at":"2026-08-06T23:20:00.771769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.569189Z","title":null,"venue":null,"work_id":"8357c004-8a19-49fe-8a50-0dc506921295","year":2020},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:00.940491Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:0c1b39fcea14eaff0aed2b9554e58d2081395132eb42b29670b909bd1d44a88d","observation_id":"84d11dd7-80f8-4fce-929c-67c01f7d8945","resolution":{"observed_at":"2026-08-06T23:20:05.669312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:05.214823Z","title":"Tables as texts or images: Evaluating the table reasoning ability of llms and mllms","venue":null,"work_id":"36626f6c-bd62-43a8-825e-5ef2557a2576","year":2024},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:01.257151Z"},"links":{"citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:43133708c3746f7100e7bed2a89b28bcf0d9229fe612cdb146cb2ef67ceb5c83","observation_id":"c8c641df-fc1f-43b5-ae47-b30e5d7f0afa","resolution":{"observed_at":"2026-08-06T23:20:05.289155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T04:51:23.225769Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2506.18421."}