Pith. sign in

Paper Citation Record · LEDGER

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models

As of 16 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.21409.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.21409 v1

Coverage vector

measured 61 of 61 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:32:50.913865Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

61 of 61 outbound references displayed

  • verified exact7
  • verified fuzzy16
  • unresolved34
  • parse uncertain0
  • malformed identifier3
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 07e3c137-1528-4fef-8fd3-8ee46e10ba6c · outbound

This paper cites Ai hallucination report 2025, 2025.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Ai hallucination report 2025, 2025

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:59.261936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.361753Z digest=sha256:7517c1a529ac5a71b24856a9db24006c860db63e56fc967605cf057a758e6723

Observation db2fe7a2-deb1-4651-8dfb-b2face751cf2 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:59.051641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.403729Z digest=sha256:efe114955875deb018d2f3673d5546c0f90386713563db82cadd5c6704ffc12b

Observation f386ed11-ef70-4e89-b24e-978300c46ede · outbound

This paper cites Balsiger, H.-R.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Balsiger, H.-R

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:58.749755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.441750Z digest=sha256:90413e6a7fa07b791d817e36253fd9a8d764edaa21ebed1c903a25fd8fdf2f1e

Observation 09c7ceea-687d-4aab-841f-bb57859f6cac · outbound

This paper cites Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.520937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.520937Z digest=sha256:d2dd17c1d92151cc5f446774339f3c8fb640dda35ed94f4274f242a035c006ea

Observation 83d20bd7-532e-4110-9a9a-e04daa29a71b · outbound

This paper cites Borisov, K.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Borisov, K

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:58.517294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.573788Z digest=sha256:a94dd7386d0ce5671963aedc7dad28afaf5b2e2e47e752d05cc396bb6492baaa

Observation 5a333f0c-374c-44d2-8ba9-77c3db137e51 · outbound

This paper cites Buoncristiano, G.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Buoncristiano, G

Reference 6

Resolution
verified exact
doi, observed 2026-08-07T13:32:52.299853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.625119Z digest=sha256:38e2440706b6b2d27f98835676536e63d4b64b33c2424bac672cd72d3d9431d4

Observation 21db787f-3b63-472b-a4e7-8305a2cc2a45 · outbound

This paper cites Retrieve, Merge, Predict: Augmenting Tables with Data Lakes.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Retrieve, Merge, Predict: Augmenting Tables with Data Lakes

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.676074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.676074Z digest=sha256:21487938467add436a81771c19fb2d62825785c900ee568380990bcfb90bd0b7

Observation c3536f04-1b0a-4238-b799-71090ed6f0d8 · outbound

This paper cites Chang, X.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Chang, X

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.713259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.713259Z digest=sha256:c60e557d0be0377c24d61e8558d5debecc25cafee02cafa0ad9cff8a734f2c5b

Observation 3de3a363-6858-4b22-bd6b-b316ecd28949 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:58.348469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.750093Z digest=sha256:ace8770359e647d4d8e1ca8362b4aa439bfcb7b7fd3233c41f31cca60a8acbaf

Observation 539ed863-a7ca-4ace-bee0-2aa5697e9122 · outbound

This paper cites Chowdhury, D.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Chowdhury, D

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:58.162748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.790043Z digest=sha256:7aef370c35d9793cd5dbe2d75d6551a5000dbdd48c52f53299636dba00bdff06

Observation 6ebb0201-619e-4392-9502-01af1f438bcc · outbound

This paper cites Christophides, V.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Christophides, V

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.979386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.827253Z digest=sha256:0904c7bb5b91d3d23ea4053fb6f31684fe2bfc7b328248380be81603c5cd4690

Observation 9b9c87c3-d87c-4b35-8027-caa2498e6fc6 · outbound

This paper cites DeepSeek LLM: Scaling Open-Source Language Models with Longtermism.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models DeepSeek LLM: Scaling Open-Source Language Models with Longtermism

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:46.863793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:46.863793Z digest=sha256:6b5b547143ca46ef98373075a990297f9fedb833306a8a63e55ef1b9c10717ab

Observation ccc29672-a4f9-4b2f-8a84-b3a2504f780e · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:57.759832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.949789Z digest=sha256:45fc058bcabd9e9ac03944dc8ee07d2f1ee972230485a79da9c518fb80e3877c

Observation df98fbb8-4333-4889-92e7-52e433d66a7b · outbound

This paper cites Elnashar, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Elnashar, J

Reference 14

Resolution
metadata mismatch
raw_fallback, observed 2026-08-07T13:32:53.373000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:47.101631Z digest=sha256:6796cde6f302291d0b2e6e4ab1781fd8070e42722cd818343eb8e742561ddbc3

Observation 08c5554f-d8b2-4bf7-9373-0fa7ba694972 · outbound

This paper cites doi: https://doi.org/10.1016/j.accinf.2024.100715.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models doi: https://doi.org/10.1016/j.accinf.2024.100715

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.021461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.021461Z digest=sha256:555bbb897d2ef681e5198c9cf5fb4c3c50a963057a14713e2233a4493577a7f6

Observation 04667e40-d325-417c-be23-747a66d0cc9d · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.265524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.265524Z digest=sha256:fa217a6541f415d982d1147d7f120a20d4aacee48b0a6d60c165cd7f8073ce97

Observation 9f9808ce-865c-42ec-99b6-36da7c895896 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 17

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:32:47.190773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.190773Z digest=sha256:3d975fdc3baf353540d6814061f27abb3280477c2f2bcc928f8f1e6149c5c394

Observation c55372c2-1aaa-46f7-83f6-e76287c276b7 · outbound

This paper cites Holtzman, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Holtzman, J

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.520675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:47.392521Z digest=sha256:def33cf8eff88e26fc8e39b94bd924c82a00cf84a67643477cd59066fc2689cc

Observation 5d98f628-b3f6-4e59-9b1d-f2e583163ebb · outbound

This paper cites Glavic, G.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Glavic, G

Reference 19

Resolution
verified exact
doi, observed 2026-08-07T13:32:52.010553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:47.329050Z digest=sha256:d760c922b371189cad0a16c06faa617520ceefb2be024a31d8daaed1c18c8210

Observation 1f775385-3eef-40b5-8c87-0d5b04d31c49 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.559143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.559143Z digest=sha256:f7e4b5d2f33154d2ba9978938ff6bbb1b744383b3da5a8690941dbf978201525

Observation 7648c6b5-6d7b-4221-a791-bd58a2912d55 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.478077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.478077Z digest=sha256:b51e4c4521badf03e5714176f9f3c3ee6378a46a109eeae764f644a9d3a81af9

Observation 8f6d8c24-3092-4da0-9839-90c9010a4939 · outbound

This paper cites Joshi, E.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Joshi, E

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.315874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:47.778376Z digest=sha256:52dcba004a1b83f8b663ce6e72f7733446d5d4aa14342e68287dfb0bc75f3db5

Observation f9bc9594-3b18-4636-a527-fdaf7ec9b2e3 · outbound

This paper cites Mistral 7B.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Mistral 7B

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.623703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.623703Z digest=sha256:ee6e1d899ec9e6c79082cd4ced718f1c8560d9d1204cf7acbf515d525f1156b6

Observation 07134d5f-adf9-4e76-b9f3-13bc1c1d65d0 · outbound

This paper cites Open-WikiTable: Dataset for Open Domain Question Answering with Complex Reasoning over Table.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Open-WikiTable: Dataset for Open Domain Question Answering with Complex Reasoning over Table

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.935799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.935799Z digest=sha256:c9cb4c4501284f16332a96a0ec333c352ee79c4e899be364d3d4dd09f5e7c6c5

Observation 75b5265f-a770-4f4b-a55e-786304332ccc · outbound

This paper cites Kwiatkowski, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Kwiatkowski, J

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:56.853352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:48.009190Z digest=sha256:58d8766252cdf0fdf59e3dc99b0dc409c69a4ebf0d9cf37d3d143fe76306b3d0

Observation d849b4bf-17e1-4e8a-a17c-0de972ad3745 · outbound

This paper cites Kasneci, K.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Kasneci, K

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:57.073960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:47.860715Z digest=sha256:ba7d493e8370a42f88d91e8fab1169cb6ea2faad62219f3e3824801899ca3b49

Observation 03ba16d3-e65d-4c38-9153-14c06ef62a34 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:56.626350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:48.148989Z digest=sha256:368610c420b92bd8ebc45645f5e5572778b7cefb2a96385c5a6cdcadbfc1aaa4

Observation ef23b778-e2ee-4279-ad2b-b2f3286ff541 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:56.448911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:48.227184Z digest=sha256:18a1fb63e6dd3bbbe5444ecd9521cbb9e2489ebba9406fe332084d8ca8a7a8a1

Observation 8047c490-164c-4fb7-b9dd-bd8b8615ba34 · outbound

This paper cites Lee, M.-W.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Lee, M.-W

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.066912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.066912Z digest=sha256:f4cdf8ff5b8f325501ace56d76b5dcffd9e77238e7e034853b5de4cdf63cec62

Observation d711835e-1280-4b37-bf07-db934020e050 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 30

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:32:48.433952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.433952Z digest=sha256:dea5b5e96c941019d02dbb3bf18b84567c5233c25acbffc04222244260bcecba

Observation 72d61015-d0fe-4da7-b5f8-f561bddc1362 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.521291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.521291Z digest=sha256:d845de63318e0fef26be04b8d6688da44aa45edd08aa7096bf114c69fbf1e085

Observation 2b4bc770-9318-4679-b948-ecb4b16afbbc · outbound

This paper cites The Llama 3 Herd of Models.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models The Llama 3 Herd of Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.609492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.609492Z digest=sha256:f39e19749afac0363f6dbad79805a5d04e3f9f6847c114b00b079d229a79585a

Observation 48022fea-0bfc-464d-a74c-451b1da09a50 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:56.258592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:48.357266Z digest=sha256:cd36e42d22cbed9a7f9d1c39a31c140ca146af812db3638744b75d13b5df7200

Observation 203906d0-b638-40db-9095-63eb26094c58 · outbound

This paper cites Papicchio, P.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Papicchio, P

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:56.093936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:48.801222Z digest=sha256:ddff5b46d004e43c37d367093d826cc8b3d98ffa86767aaac9485c9cdb2ca139

Observation 3ee3bf0f-0a9c-4f6c-b505-6038d0c9fac2 · outbound

This paper cites Pasupat and P.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Pasupat and P

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:55.903693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:48.872971Z digest=sha256:16c64788e0edd64851bb3ac90bb9ad9fea53e88c035bb33637bf3f55c558f9d9

Observation 53540648-f8a8-493c-8e1f-b972c4829785 · outbound

This paper cites Semantic Operators: A Declarative Model for Rich, AI-based Data Processing.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Semantic Operators: A Declarative Model for Rich, AI-based Data Processing

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.953399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.953399Z digest=sha256:c6a0ef48ffecb03f4bd1068737f8bd59f9fb65eafce790e140a384369e01d356

Observation 4bb87158-d39f-489e-8709-8416759587c1 · outbound

This paper cites GPT-4 Technical Report.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models GPT-4 Technical Report

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.702771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.702771Z digest=sha256:d372cefe54b8e0e3493e55c467afcbe8b22788871ca72e19c498b853d60bab78

Observation 7e8e62e6-53d7-420c-93e4-800ae8fd1de9 · outbound

This paper cites Petroni, P.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Petroni, P

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:55.477197Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.165647Z digest=sha256:64d2cb26e436decab54478d796f490eb0b6d44d85c6ede4b6704b5c1f7a68a76

Observation 346a7052-f8cf-4ad8-902a-20fa0f0b3bd2 · outbound

This paper cites Qwen2.5 Technical Report.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Qwen2.5 Technical Report

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:49.327226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:49.327226Z digest=sha256:c4a96ab2bd199823b21c5faeaf5c4f3e4dc3f039400e952f0aace70806617e8e

Observation f39c3868-ee30-4293-9d2e-30ac78f08a52 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:55.007684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.414543Z digest=sha256:a26db01ed44951edbe6118696edb5ff422ca3120e2d2262ed9b0a5ff1f1cc41a

Observation 5617f6dd-a755-4803-bf1c-fa10dbccc684 · outbound

This paper cites Petroni, T.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Petroni, T

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:55.666087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.017964Z digest=sha256:cec00d5f4b651452808967afa75374aaffdd39f15b55518d8d9397b792588ea4

Observation 214e4505-e483-4ee3-a224-aaef144eca94 · outbound

This paper cites Saparina and M.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Saparina and M

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:54.724969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.681402Z digest=sha256:f9f0c012233b886af362f8d5267dc078c4757c1a10a9b808351cdcae2363e25f

Observation f2628c97-c9c0-4033-b7cd-b815f8e49dd5 · outbound

This paper cites DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:49.753681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:49.753681Z digest=sha256:ebc9a45abf9ecf591953e6e3cd020d6f5590d806797cde5ed1ba600ff350f0e0

Observation 5393e0aa-2a2f-4186-b6ab-b3c38c2baa2f · outbound

This paper cites Singhal, S.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Singhal, S

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:54.457394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.844507Z digest=sha256:40a61a978b9e15ba49a035049fb8870e1a756a966bcb839c6b37b473dda2bd2c

Observation 56c35b50-fe33-4bc5-ace0-e2f4d064e867 · outbound

This paper cites Stuhler, C.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Stuhler, C

Reference 45

Resolution
verified exact
doi, observed 2026-08-07T13:32:51.146841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.922990Z digest=sha256:8f33d5f8df9e5fd4d45d464c933f7bbd4896dff30192aeddb5051ad87d980129

Observation 31cc0abf-f788-4a7e-8436-331998aaef12 · outbound

This paper cites Saeed, N.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Saeed, N

Reference 46

Resolution
verified exact
doi, observed 2026-08-07T13:32:51.625148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.511762Z digest=sha256:a228dbb4cf6e82996c1293a1b99bed4c1caf7300bee4b3aba14de387919fcd87

Observation 462e6e3c-9e7f-4112-be47-7ce49f70b95c · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 47

Resolution
verified exact
doi, observed 2026-08-07T13:32:51.376941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.580285Z digest=sha256:c8e890c5b65bc9a13dbde1e9412c7d2e814be7dc2e5b6596b25f7abe51b9c5ca

Observation f584738f-6c6d-449e-bf4f-c33a73286a87 · outbound

This paper cites Truhn, J.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Truhn, J

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:32:54.214399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:50.181882Z digest=sha256:0fe052eca36c250327f93ee7c0f773fbea1b6b496cfa87c70ffec98f18939f67

Observation acbd60b6-dba9-4d11-8652-d52550417321 · outbound

This paper cites Measuring short-form factuality in large language models.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Measuring short-form factuality in large language models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.289751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.289751Z digest=sha256:388fe8da00d7ceb3b8f15dbcbf837da93c10ee62df8a60b2bdd3d3fb48fd2e34

Observation ffa750af-20cd-4e63-9098-d18d57002d8a · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:53.944357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:50.376486Z digest=sha256:a5a90ed270ab9602ef3edf20dcd17aacabb8e8e4d8f90944cfa8bb21e232e467

Observation 80ac46d7-739e-4dfd-a43a-8510c0dbccc0 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.438462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.438462Z digest=sha256:b361e736375dc8f24bb3f96ffac87c8a3dbb83821ebab6088224b25d061ce46f

Observation fa26c866-5deb-493d-8ea9-74b2814f7e04 · outbound

This paper cites YAGO 4.5: A Large and Clean Knowledge Base with a Rich Taxonomy.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models YAGO 4.5: A Large and Clean Knowledge Base with a Rich Taxonomy

Reference 52

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:32:52.885759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:50.036801Z digest=sha256:ed57fcdb265e8555f973f494f21d1bd59d912e2f8d5148690811e25f326e06a5

Observation 51a3bf34-1a99-41c8-be65-de9f2fc3be9c · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 53

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:32:50.108142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.108142Z digest=sha256:dcba327738bdd6a77449100cdb092b2a894ad517d8a217cbd16e9b99333658b6

Observation 1f7e146c-038d-4741-8944-43da98534dda · outbound

This paper cites Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.822133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.822133Z digest=sha256:936c55c112352c362320d1c860fa2cd3c4c7fe0000589de0469afc9bc2c13820

Observation 85c57c1d-5f7a-4778-b8c9-00cb62d2b7bc · outbound

This paper cites bird”, “galois.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models bird”, “galois

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.913865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.913865Z digest=sha256:ad080f8d51b62d27c30377ee98b928930995d5db4abbf44257386a5199afa002

Observation c30f6445-753b-4c35-bd49-80e5b3e8ccc1 · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:53.698539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:50.566418Z digest=sha256:3a38fb9b645e191ec2ab1bbae296198f2df12297d39bc7e44eead99acef0f1ba

Observation 6bff2db9-7609-4480-b209-367f9cc1daba · outbound

This paper cites TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:50.689286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:50.689286Z digest=sha256:bb6bedae5dbc5d16608b5ba28443d115b03c2b957f8b2754ecee93e1dc080aca

Observation 88eec023-3341-49c6-969a-3536460f28ae · outbound

This paper cites an unresolved cited work.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Unresolved cited work

Reference 2020

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:32:55.258363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:49.254197Z digest=sha256:d966f538f565f446ae71943fe909a9068f108fb65ef52b5736de27ce92098963

Observation c5c90338-bdf0-448d-867b-c46c29e78773 · outbound

This paper cites TruthfulQA: Measuring How Models Mimic Human Falsehoods.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models TruthfulQA: Measuring How Models Mimic Human Falsehoods

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:48.282123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:48.282123Z digest=sha256:5998cadb348822011bc514ed3197ee6ec9abcb539d51d600953d81d798a5fdab

Observation 23a283f7-c1e8-4d6f-9126-2fc6563a52d4 · outbound

This paper cites Mistral 7B.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models Mistral 7B

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:47.702623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:47.702623Z digest=sha256:eabc57c45b571a8fb352cf41c8947af370a6581fece43e4da1db77dc5a778d1d

Observation 29306f15-a00a-40f5-8bf4-dd5123b49722 · outbound

This paper cites doi: 10.3390/computers13100257.

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models doi: 10.3390/computers13100257

Reference 2024

Resolution
verified exact
doi, observed 2026-08-07T13:32:52.618710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:32:46.481258Z digest=sha256:a81844d36dc33bc215338b8322bb04a0576c1947e2c084788ae5e381c580f513

Pith citing papers

No inbound Pith citation observations are available.