Pith. sign in

Paper Citation Record · LEDGER

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism

As of 19 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2412.17933.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.17933 v2

Coverage vector

measured 19 of 19 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T05:11:53.076473Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:58:15.046582Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-16T00:58:15.143517Z

Reference resolution

19 of 19 outbound references displayed

  • verified exact0
  • verified fuzzy10
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 91353968-e45e-429d-91ec-25358e755dfb · outbound

This paper cites OLMES: A Standard for Language Model Evaluations.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism OLMES: A Standard for Language Model Evaluations

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.008559Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.008559Z digest=sha256:1f0c8869aab9519353be9e0216d3f82deb01d2c100a67a4893deb2f9773444f0

Observation 24db0678-5e50-4973-b5e3-948ade7aa7c3 · outbound

This paper cites Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.341556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.014735Z digest=sha256:f0f1729ade4d86ccea9a7e139b21521678916460ed58385b5307e946d3e91604

Observation 9aa41d7c-79fe-4c2c-bfd0-37a8d56406cc · outbound

This paper cites Poro 34B and the Blessing of Multilinguality.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Poro 34B and the Blessing of Multilinguality

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.025254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.025254Z digest=sha256:82ee5f93e8b6f03feee046be4634242d881ebcfb3570d1d8ece7a614cbd33a79

Observation c4a51936-c669-4d25-8d21-2a06c5a99ef8 · outbound

This paper cites Modern hierarchical, agglomerative clustering algorithms.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Modern hierarchical, agglomerative clustering algorithms

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.030238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.030238Z digest=sha256:d7f640e788a478899d59c9c1ea34554a7f6428d90f58002b56c2fa24313e7982

Observation f79551d9-dc9c-4fdb-880a-40e3c4d34d34 · outbound

This paper cites Ústav ˇCeského národního korpusu FF UK, Praha.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Ústav ˇCeského národního korpusu FF UK, Praha

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.356683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.002996Z digest=sha256:7848e1aa04bc209b84463f899f36571ee2536cb31c061a6e1574ec913bf3fd31

Observation a0aabde0-d0ac-4880-9271-5fd26780de5b · outbound

This paper cites KMMLU: Measuring Massive Multitask Language Understanding in Korean.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism KMMLU: Measuring Massive Multitask Language Understanding in Korean

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.040212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.040212Z digest=sha256:730de9ebc034964b83a9d38a4d26d56e70becd2d8d495ccc3235f6c66a28bb92

Observation 6876d1b7-9d79-4372-abcc-836390f86d62 · outbound

This paper cites Transactions on Machine Learning Re- search.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Transactions on Machine Learning Re- search

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.325246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.045188Z digest=sha256:a9e3bb5220fd84dbeaff9227c0a915159453311939aea8c299df248da893624b

Observation 1d35e610-fd22-445f-b3a4-36dbd77e5119 · outbound

This paper cites I don’t know.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism I don’t know

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.309458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.055916Z digest=sha256:edcfd8d699050d3d1de9a52d5beab8a6ab20dc450a580dab69562801083dfa55

Observation c1377cca-0f8b-4cd7-b378-7677f2ad976d · outbound

This paper cites 5 texts are original Czech works, and 3 are translations from German and Slovak.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism 5 texts are original Czech works, and 3 are translations from German and Slovak

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.294117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.061569Z digest=sha256:4e545162ec7781c6c2781edce1a7a0645a588338e32fae5cd23428c482ef011f

Observation a2c5e7e9-081b-48a7-a08c-dfed19c2859e · outbound

This paper cites • Private Correspondence Corpus (Hladká,.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism • Private Correspondence Corpus (Hladká,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.278156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.066427Z digest=sha256:a0fe1cf2113b9705151cf999f2c68f75c7a9c3448969439043ecb182f6f8ef4a

Observation fd388948-9e22-4d55-a0c2-db78b3d76fd2 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Training Verifiers to Solve Math Word Problems

Reference 1901

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:52.990279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:52.990279Z digest=sha256:6ac4e1218378195bbd7a36cd3c7f21649047e53e7b488339c665df04b1ef784c

Observation d8d6f831-d224-492f-90d6-08071433519d · outbound

This paper cites <initial 20 ws tokens>, ..., <sampled window>.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism <initial 20 ws tokens>, ..., <sampled window>

Reference 2006

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.263031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.071360Z digest=sha256:7cecafb35bcda34afd24a13dd4675e99d9b1e6fd096cb85f90dd212421c1ada6

Observation f458c937-2f0d-453c-8ded-f2b3ff1f0323 · outbound

This paper cites Ústav ˇCeského národ- ního korpusu FF UK, Praha.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Ústav ˇCeského národ- ního korpusu FF UK, Praha

Reference 2013

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.387359Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:52.984965Z digest=sha256:9d9fc536ac06ef1a2bd800e8763d99dc25b47d5020ecea2e0d13476e6860d14b

Observation b1f62c74-4019-4219-b637-0dad72a660f8 · outbound

This paper cites The speeches were made by Czech presidents, or their deputies, announced periodically on the occasion of anniversaries and public holidays (New Year, 28 October, etc.).

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism The speeches were made by Czech presidents, or their deputies, announced periodically on the occasion of anniversaries and public holidays (New Year, 28 October, etc.)

Reference 2015

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.246617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:53.076473Z digest=sha256:34824c8b4202961e5d9c0d388a327c1b96e779dbe6c0aee27f282cf9c1846240

Observation 7863614d-33cc-4ac0-836e-4379ce2ebc7a · outbound

This paper cites Mistral 7B.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Mistral 7B

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.019984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.019984Z digest=sha256:003683ce2cdeeea10eeee4ece5217a067d5cf2cdb9b5a32b80ce973677474bfe

Observation 74060821-c78e-4791-964c-a062092db89a · outbound

This paper cites Perplexity from PLM Is Unreliable for Evaluating Text Quality.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Perplexity from PLM Is Unreliable for Evaluating Text Quality

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.050856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.050856Z digest=sha256:0d334cb589d10921a5f05d27eb582b838af2d0405d4e203be7eadd583d03bb2e

Observation 2fa25e51-5f54-4ddc-a6d1-db3c32659492 · outbound

This paper cites an unresolved cited work.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Unresolved cited work

Reference 2021

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:11:53.372483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:52.997195Z digest=sha256:8d299c04789367cd3695585ba4595cbd6e6b6c01471e559b94ea8de0517c8fa0

Observation add1dddc-0135-4bde-93ed-5c05a8725fc1 · outbound

This paper cites Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-11T05:11:53.034975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:11:53.034975Z digest=sha256:dfe3879e61773d468d8cc3dc3832cc02ea028baee3b1c518ec23e2168e0b7820

Observation c907c2af-f280-4ad0-99db-1a2c779e89b8 · outbound

This paper cites In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Pa- pers), pages 7421–7454, Bangkok, Thailand.

BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Pa- pers), pages 7421–7454, Bangkok, Thailand

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:11:53.401444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:11:52.979062Z digest=sha256:9ebb06ac31a9133e74d9cc32caf1bd89330bde51fe9596616f82b333386c3292

Pith citing papers

Observation 5233ed66-865c-42f7-8d63-ba824c953867 · inbound

Bielik 11B v2 Technical Report cites this paper.

Bielik 11B v2 Technical Report BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism

Reference 68

Resolution
verified exact
local_arxiv, observed 2026-08-16T00:58:15.148677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-16T00:58:15.046582Z digest=sha256:a4c8d0ef6f5e21fd9548612442da3a8cb42a6b148e1cc8da93db913020767cd3