Pith. sign in

Paper Citation Record · LEDGER

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

As of 7 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2607.19409.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.19409 v1

Coverage vector

measured 16 of 16 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T07:28:28.305782Z

measured 16 of 16 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

16 of 16 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b31f1b67-5e0d-47a6-a8f9-dbe2ecd3160d · outbound

This paper cites Measuring Massive Multitask Language Understanding.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Measuring Massive Multitask Language Understanding

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:26.789516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:26.789516Z digest=sha256:cf5d8b5103b103a4a964326b01adb9da413a3e93bd9eda3b29a23e7e9ec4cf5b

Observation 22a1ffc2-af03-43d1-a694-b16ae67d98e2 · outbound

This paper cites ReAct: Synergizing Reasoning and Acting in Language Models.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance ReAct: Synergizing Reasoning and Acting in Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.218847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.218847Z digest=sha256:48bffc00eeffa160e0cac22bedf04f47bd65dbf0c3700e3deb26309a1229956e

Observation f515aa51-163b-4448-a82e-a3516508334b · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Constitutional AI: Harmlessness from AI Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.572571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.572571Z digest=sha256:756ae60c04eb254affabc178a9d04b6f461f6d9b4bc61a987d744006c5ee510b

Observation 68c84230-0719-4077-9057-3a32963a2eda · outbound

This paper cites FinanceBench: A New Benchmark for Financial Question Answering.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance FinanceBench: A New Benchmark for Financial Question Answering

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.670122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.670122Z digest=sha256:dbd3a62930a71fc6e62a7874a8adbbdc199b6c4c52d194963f22f483a7b1e4f5

Observation 44310c14-dce8-47fd-950a-f33026be4fe7 · outbound

This paper cites BloombergGPT: A Large Language Model for Finance.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance BloombergGPT: A Large Language Model for Finance

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.822002Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.822002Z digest=sha256:436ec0bd76091be6a3ef0ccd8818a878f64d4899657f92e1436d79b299c24f2c

Observation caa583bb-3902-4f43-824b-7bd4ac920338 · outbound

This paper cites FinBen: A Holistic Financial Benchmark for Large Language Models.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance FinBen: A Holistic Financial Benchmark for Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.915579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.915579Z digest=sha256:d94a155daa1735eca8cec058f1d081c95c10eaa3218045ed0078f7856abaef5b

Observation c3898d70-b1f3-4b57-8cda-5d3fef0b90c6 · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.015941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.015941Z digest=sha256:2670db8253c758d55d66ec4c39707fd3f2be05f2036e0e2e56aabfaa74525951

Observation 61116e77-9e8f-44a3-84c3-56f372496f87 · outbound

This paper cites Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.105727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.105727Z digest=sha256:25031f15f7b7f27009f352af3df1ab6b8887ecb54f23ae39314cfb4a18ed2920

Observation 7a7725a0-a606-4fed-86dd-a764ef40dd35 · outbound

This paper cites DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.252341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.252341Z digest=sha256:d6b8df53ac8f22b4326169223b1e724a52ef08242a03c1b89f72ad3a1aac927f

Observation 6b534a3b-1b4f-4ec0-8759-08d03701536d · outbound

This paper cites an unresolved cited work.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Unresolved cited work

Reference 1986

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.305782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.305782Z digest=sha256:38f1d395ebddef7bcfc51a52c254e472856b758f25e809d4d5448133d99740b7

Observation 22851a93-4ba1-4e46-bc9c-ef237c429330 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Training Verifiers to Solve Math Word Problems

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.448754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.448754Z digest=sha256:22903de839ed2679905c6641f532b89498e5047ed476f0a3d059fff8c85e5176

Observation a0e367aa-f3ab-449b-a20e-e680e8e7f2d0 · outbound

This paper cites Agentbench: Evaluating llms as agents.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Agentbench: Evaluating llms as agents

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:26.909728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:26.909728Z digest=sha256:3eff8e26d9e7a6a09f59e62c4a8c7592e9ad41de72e0ad2b73868f9d5518ef33

Observation f49e471a-ecac-4d35-8514-f1957937a6b3 · outbound

This paper cites Squad: 100,000+ questions for machine comprehension of text.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Squad: 100,000+ questions for machine comprehension of text

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.496811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.496811Z digest=sha256:254a930be1d70d6d7557e9a385dc4e21509839ba0cec8288e6900ffb39955f20

Observation 40fefacf-6cab-4739-8f5a-94c6d414a3cc · outbound

This paper cites $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.124883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.124883Z digest=sha256:33dd356b2d1d8d2f5630de0ea337b0c26f7d5a0b7f59db9fd164465f4985a2f6

Observation 17ed29f9-0903-4520-ba97-7e2a381c8c71 · outbound

This paper cites Finagentbench: A benchmark dataset for agentic retrieval in financial question answering.arXiv preprint arXiv:2508.14052,.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Finagentbench: A benchmark dataset for agentic retrieval in financial question answering.arXiv preprint arXiv:2508.14052,

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:28.178907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:28.178907Z digest=sha256:0d37be93a35b6e23f9dc66cc8352b000d0cdc82d6c105ec6c95aff8d4086281c

Observation a4bab4d4-68bd-4aa2-8ec9-bc873166f416 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-02T07:28:27.319464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:28:27.319464Z digest=sha256:d0f29e0d6122f90a2a58cecd83dec9d94f371e02f2d92effe4249239286381af

Pith citing papers

No inbound Pith citation observations are available.