Pith. sign in

Paper Citation Record · LEDGER

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2607.19409.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.19409 v1

Coverage vector

measured 16 of 16 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T07:28:28.305782Z

measured 16 of 16 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

16 of 16 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b31f1b67-5e0d-47a6-a8f9-dbe2ecd3160d · outbound

This paper cites Measuring Massive Multitask Language Understanding.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Measuring Massive Multitask Language Understanding

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:26.789516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:26.789516Z digest=sha256:23d5f3947ffe98de4a9a00413f4b1d526c29dd9cfe253af759a7789ef115c650

Observation 22a1ffc2-af03-43d1-a694-b16ae67d98e2 · outbound

This paper cites ReAct: Synergizing Reasoning and Acting in Language Models.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance ReAct: Synergizing Reasoning and Acting in Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.218847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.218847Z digest=sha256:c96af9af45a27e27749a16cce0a30ce8da447b320f61c362be05e55b84fa9076

Observation f515aa51-163b-4448-a82e-a3516508334b · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Constitutional AI: Harmlessness from AI Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.572571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.572571Z digest=sha256:09f3ec5196a7698daa70dc7de9fb67ee1271705ae605a6cce9d1cde420cf1d7b

Observation 68c84230-0719-4077-9057-3a32963a2eda · outbound

This paper cites FinanceBench: A New Benchmark for Financial Question Answering.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance FinanceBench: A New Benchmark for Financial Question Answering

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.670122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.670122Z digest=sha256:15e3ebffa16641468faebfd6d896620e5bb3a0bf4adf325b6ffdf64d80ba3f78

Observation 44310c14-dce8-47fd-950a-f33026be4fe7 · outbound

This paper cites BloombergGPT: A Large Language Model for Finance.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance BloombergGPT: A Large Language Model for Finance

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.822002Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.822002Z digest=sha256:23dcf45b55f1c3fa6194e800844479851c7770632980ac614358528b05371020

Observation caa583bb-3902-4f43-824b-7bd4ac920338 · outbound

This paper cites FinBen: A Holistic Financial Benchmark for Large Language Models.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance FinBen: A Holistic Financial Benchmark for Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.915579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.915579Z digest=sha256:8197487dd89cb8949d9d04f3d79aab5165a20170feb1ff93f35d1f28e7bbac74

Observation c3898d70-b1f3-4b57-8cda-5d3fef0b90c6 · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.015941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.015941Z digest=sha256:0d89049b2fe529c51767e2f3ed3b5473889c0d4dbe3e402861e6be7329b05314

Observation 61116e77-9e8f-44a3-84c3-56f372496f87 · outbound

This paper cites Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.105727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.105727Z digest=sha256:badf8a8b240ceb32c15bfbef33cd2e4d04f82dc38ddc5f108b05161fdd254b0f

Observation 7a7725a0-a606-4fed-86dd-a764ef40dd35 · outbound

This paper cites DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.252341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.252341Z digest=sha256:16864be179efa28c08bdbf1e0a49d61403bec3194c8922fc09b1ec40e2ffca73

Observation 6b534a3b-1b4f-4ec0-8759-08d03701536d · outbound

This paper cites an unresolved cited work.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Unresolved cited work

Reference 1986

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.305782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.305782Z digest=sha256:989d664f159c6684ec018d86bddee2ec2a75952f395ba659f37bbdf7aabbad2c

Observation 22851a93-4ba1-4e46-bc9c-ef237c429330 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Training Verifiers to Solve Math Word Problems

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.448754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.448754Z digest=sha256:ae1edf3b3af6795ec9581b6e14beb66945429394088a8b785bfc771a4049fc93

Observation a0e367aa-f3ab-449b-a20e-e680e8e7f2d0 · outbound

This paper cites Agentbench: Evaluating llms as agents.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Agentbench: Evaluating llms as agents

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:26.909728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:26.909728Z digest=sha256:b8c10a8b925d45b7322427df7ea7fbea51a4511a2d798773d2247c3b1cd253c6

Observation f49e471a-ecac-4d35-8514-f1957937a6b3 · outbound

This paper cites Squad: 100,000+ questions for machine comprehension of text.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Squad: 100,000+ questions for machine comprehension of text

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.496811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.496811Z digest=sha256:e36d7817baf91923e67b9c6dd92403011d0afd2ec3ef52dee792c484ad4de68b

Observation 40fefacf-6cab-4739-8f5a-94c6d414a3cc · outbound

This paper cites $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.124883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.124883Z digest=sha256:74a3f94deb12db4a6c0c894167abedfb774a456b5c1e28a1406c4a9e6fa791b6

Observation 17ed29f9-0903-4520-ba97-7e2a381c8c71 · outbound

This paper cites Finagentbench: A benchmark dataset for agentic retrieval in financial question answering.arXiv preprint arXiv:2508.14052,.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Finagentbench: A benchmark dataset for agentic retrieval in financial question answering.arXiv preprint arXiv:2508.14052,

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.178907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.178907Z digest=sha256:f439161fb0429a39081cb765078bcb4431d661c674a7607b3dadbd4718ec1a60

Observation a4bab4d4-68bd-4aa2-8ec9-bc873166f416 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.319464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.319464Z digest=sha256:d762d4b44541744950d1ca3d0942e89009fde2ed5147bddc590182ece04d5ff5

Pith citing papers

No inbound Pith citation observations are available.