Pith. sign in

Paper Citation Record · LEDGER

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models

As of 15 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2507.18182.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.18182 v2

Coverage vector

measured 78 of 78 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T14:45:42.780856Z

measured 79 of 79 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T17:21:27.531024Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

78 of 78 outbound references displayed

  • verified exact4
  • verified fuzzy40
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5216c661-9e79-4deb-9ee1-06cda3c739d5 · outbound

This paper cites GPT-4 Technical Report.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.561961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.561961Z digest=sha256:5ac7f3e50326422adbc3448a62b479b34d354d88214b1bba2da1932487a0098c

Observation cb2282c2-f384-4bd5-b127-3f706c3f7a62 · outbound

This paper cites Sparks of Artificial General Intelligence: Early experiments with GPT-4.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Sparks of Artificial General Intelligence: Early experiments with GPT-4

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.566066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.566066Z digest=sha256:3bc074baab80238bcef0c3de433a3f41a627a9846aa2d22493125af08964b058

Observation 2760630c-638e-44ae-86a4-a0c55b30d2d3 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.569568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.569568Z digest=sha256:cd3cdc4a08287046176750233c518a2790edf1f292d773a8ceac11b86839f238

Observation f9293f9f-fa3a-444a-b726-edeaf7c1a832 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.572487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.572487Z digest=sha256:08024ed863cc3a258b7f22bf07b4a9a4bab42c1c2a63329d8573635c20a155fb

Observation 218de190-04dc-4364-95d0-850a2e06143d · outbound

This paper cites The economic potential of generative ai: The next productivity frontier, 2023.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models The economic potential of generative ai: The next productivity frontier, 2023

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.621636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.575869Z digest=sha256:2610a59fe2d08666d52d8e8f657ea10a8ec869a36e2c959dd0c41093f3bc1bb8

Observation a77f83e9-b076-47b2-bab1-54b48e044733 · outbound

This paper cites Pwc is accelerating adoption of ai with chatgpt enterprise in us and uk and with clients, 2024.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Pwc is accelerating adoption of ai with chatgpt enterprise in us and uk and with clients, 2024

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.612570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.579151Z digest=sha256:e763da90b2f475ecc62994e48187c15f59e1a9fb2490ddd52adec3d013a48e85

Observation 8d2d8d73-ee8e-4180-82a9-32fcbcc1dac6 · outbound

This paper cites Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.582894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.582894Z digest=sha256:a469df4f5b260eebcaf182652a463fe5d6394f7e4453ac566e82d4180da8f526

Observation 58eb326e-4fdb-4ed6-9560-5333f4283e41 · outbound

This paper cites Shortcut learning of large language models in natural language understanding.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Shortcut learning of large language models in natural language understanding

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.603251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.585882Z digest=sha256:2ece7c0dcdc4a5fce461e98b3558d5314d1ebfcdb745e1889e6723e7c7f037ca

Observation f349f8bc-052c-40fb-9d71-1c872ffe3904 · outbound

This paper cites Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:43.145432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.591793Z digest=sha256:14a0c233a0af4c1225cc0bddb58b40ce5e434bd8f4adb1c3edc86221ae5952c9

Observation 48e8a152-485c-49e4-9a07-f5963bc2dd57 · outbound

This paper cites CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.595463Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.595463Z digest=sha256:eb9c617f0752a47195aed5a70ccb0ea6bdecc2941b25bb6ddd45bcfa8dd7158f

Observation 804d4f28-d333-42c6-9101-1f053eb2d790 · outbound

This paper cites Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:43.124439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.598610Z digest=sha256:e549191553923428376c8d50040573238b6bcdafa5595ff55b131b362e99f096

Observation e2ddc13a-a790-4983-8e6b-0df7fcbf2a43 · outbound

This paper cites Language models are few-shot learners.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Language models are few-shot learners

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.601429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.601429Z digest=sha256:8eae513909f30a0c77feb60177e358cb3250a6eeb8b6a39ff063ca5f21ec48f3

Observation 0cc113ea-39ac-4f19-a6ef-57a2f6c3590c · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Exploring the limits of transfer learning with a unified text-to-text transformer

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.604125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.604125Z digest=sha256:5521be56799a67d58ee1338ec9b0f0204aa07c2d013115867beb93671cbd237e

Observation d5ea368c-46eb-4423-8f61-3f20b0bb8b88 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Measuring Massive Multitask Language Understanding

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.607027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.607027Z digest=sha256:218b615e549bb5dbf688d61a12a3fa99245196317d7ecfeddd6e18b2c6e0af0e

Observation 792dc029-15b8-4a49-bf2f-6bb7d7223cfd · outbound

This paper cites Commonsenseqa: A question answering challenge targeting commonsense knowledge.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Commonsenseqa: A question answering challenge targeting commonsense knowledge

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.581828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.609512Z digest=sha256:5e5e7f2a9e2c32f68197d9ccbba165ea22ff552794e49985bba7a0ebdfd0db8f

Observation ca26ebfc-5895-458f-80aa-cdd3cebe1982 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.612530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.612530Z digest=sha256:57b53381a6f5ec5c5b8ee35b527a01301e9ab3500fa0246cb47b80634e35e1f9

Observation ad484efe-39c1-4c9f-9489-a11f91e62622 · outbound

This paper cites Can a suit of armor conduct electricity? a new dataset for open book question answering.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Can a suit of armor conduct electricity? a new dataset for open book question answering

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.615299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.615299Z digest=sha256:c61cad739de0bc441158f97b0167c74a1c35ed9d055a3b7c44c7ad83a8fba631

Observation bd3fae3e-6895-46f2-8f8a-9d697081e08e · outbound

This paper cites Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Beyond the imitation game: Quantifying and extrapolating the capabilities of language models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.567456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.618154Z digest=sha256:10b54685c7f17af6fe6ea9d641d67e6ae9f56c0c900abb23d66abbdaed91e111

Observation b91a51a6-a339-4d1e-b70a-3fb91eafeb9b · outbound

This paper cites Holistic Evaluation of Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Holistic Evaluation of Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.620508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.620508Z digest=sha256:8c211d96074c4f664703be2e4f0a568cff44b9f864c18b2704cd1d8b07b8107f

Observation a999ef10-10e4-4015-be27-90b254a96c08 · outbound

This paper cites M3exam: A multilingual, multimodal, multilevel benchmark for examining large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models M3exam: A multilingual, multimodal, multilevel benchmark for examining large language models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.558566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.623159Z digest=sha256:8a878c2c6d410a47af146736d846c96b573cb8656c5cc3fb4ebc3befced3c4a7

Observation 8123bda6-f4b8-46fc-8f07-d6a3cbaaecc7 · outbound

This paper cites Agieval: A human-centric benchmark for evaluating foundation models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Agieval: A human-centric benchmark for evaluating foundation models

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.549898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.625905Z digest=sha256:b919a4231ee4bc7e25c7aaf3bb45938310e41338282275830c5d7ffd5111e5a2

Observation d3e3c2aa-2ceb-4a65-8b2d-724c83c9f536 · outbound

This paper cites Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.628168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.628168Z digest=sha256:f7bbe1b26db3b285148ba17629c652aa8ddd885f447f1923b7be946968198d20

Observation df6b1510-bd09-462b-9813-4e35ba20437d · outbound

This paper cites Crowdsourcing multiple choice science questions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Crowdsourcing multiple choice science questions

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.630597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.630597Z digest=sha256:f86770e444af61debc276046fa6ae882eea8df889456542851401aa52b55078b

Observation 0d09c583-8dd4-40cc-b490-2e0d5ca64a9d · outbound

This paper cites From live data to high-quality benchmarks: The arena-hard pipeline.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models From live data to high-quality benchmarks: The arena-hard pipeline

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.529542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.632984Z digest=sha256:6420b8a29be811e1858a776ce722dcae4d948c14418725964bfc212c6c5892e5

Observation e3db5bdc-e636-4f69-a407-95adab2f9f80 · outbound

This paper cites Chatbot arena: An open platform for evaluating llms by human preference.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Chatbot arena: An open platform for evaluating llms by human preference

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.635387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.635387Z digest=sha256:b69d95b66452979ebf53dfc0ffc5f2c3694a7995b531f0dfc52d8936727ddaec

Observation 9f7a62ba-9fde-4987-ae00-0777e92a8a65 · outbound

This paper cites Large language models are not fair evaluators.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models are not fair evaluators

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.514598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.638295Z digest=sha256:739f013a6f09a650fdd13beccc7b59007e22ca9fe684242db5a7a4e7efabcdbf

Observation ab2c8cd0-06b0-4f5d-9b3f-6be3e265e722 · outbound

This paper cites Apbench and benchmarking large language model performance in fundamental astrodynamics problems for space engineering.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Apbench and benchmarking large language model performance in fundamental astrodynamics problems for space engineering

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.505622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.640769Z digest=sha256:fe0d8058826b040cd3f24a4075b4f15fe1713e34e4381866ea243ebd05b8f2b3

Observation ecf966ea-e5af-4d75-a462-0c8c733f6360 · outbound

This paper cites Where is the answer? an empirical study of positional bias for parametric knowledge extraction in language model.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Where is the answer? an empirical study of positional bias for parametric knowledge extraction in language model

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.495745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.643189Z digest=sha256:6ae3c1adaea5f0dde200d7b59c700098aca88131e70e8787b0c8e9da99cdaf5a

Observation 64cad35f-936a-4df2-9b8a-c5f5aff12226 · outbound

This paper cites Option symbol matters: Investigating and mitigating multiple-choice option symbol bias of large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Option symbol matters: Investigating and mitigating multiple-choice option symbol bias of large language models

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.485373Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.645709Z digest=sha256:3f260a4a51bf1def09108a37f790aad09ae1e54f9af26bd442ed83236ffce0a4

Observation 0627c88b-3464-416e-bfce-57c47b93af5b · outbound

This paper cites Large language models sensitivity to the order of options in multiple- choice questions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models sensitivity to the order of options in multiple- choice questions

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.476599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.648245Z digest=sha256:00598ae36dbdb6cfc4f9bea07eba545d31a39f9c48df6c600877f02e0f96982b

Observation 23bf2d76-da00-464e-8b44-1cf3feee1a49 · outbound

This paper cites Large Language Models Are Not Robust Multiple Choice Selectors.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large Language Models Are Not Robust Multiple Choice Selectors

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.650856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.650856Z digest=sha256:c102c6ef8743d9797910607d0fcdfe7f32695d5e1e1abf029a3a4ea6c982c5f3

Observation fee25609-a4fd-4c9e-b357-493252f824f9 · outbound

This paper cites Fool your (vision and) language model with embarrassingly simple permutations.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Fool your (vision and) language model with embarrassingly simple permutations

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.467133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.653438Z digest=sha256:7c99c4f6c4ba6d78de93e4c81fa162f1521cc0fbaf3b37fa55a5431322ed48bb

Observation 4fd8a892-a18c-4df6-acf8-52a6a94ba69c · outbound

This paper cites Teacher-student training for debiasing: General permutation debiasing for large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Teacher-student training for debiasing: General permutation debiasing for large language models

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.458257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.656108Z digest=sha256:10429db3fae02a0174bbae50ee62223d23e57daba275c40e255a1a7efc90000f

Observation 49d0fb8b-749a-4c49-a354-e988cd73e886 · outbound

This paper cites Mitigating Selection Bias with Node Pruning and Auxiliary Options.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Mitigating Selection Bias with Node Pruning and Auxiliary Options

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.658846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.658846Z digest=sha256:c4001f65f20d051a9a50ec113b884feea8da2d4746185904ccaf1cbc83380bd8

Observation 27c90e41-76f3-4519-8ba4-c8865cdb35ec · outbound

This paper cites Unveiling selection biases: Exploring order and token sensitivity in large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Unveiling selection biases: Exploring order and token sensitivity in large language models

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.448857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.661589Z digest=sha256:0d5cac66f442f434ecb059c4a0b47b3dcc47d5455a7e5abe4c6c1ae6c29f1543

Observation c5073e1d-af59-4fab-a0aa-60dbc4c9be1b · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.664558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.664558Z digest=sha256:d38fbf401197fb45b9fc1cdbf364043bbb9f6d203f0f0f19b699ed7c5724e353

Observation c5c97aeb-d96c-41b5-b53c-15482b0c79ff · outbound

This paper cites Large language models are zero-shot reasoners.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models are zero-shot reasoners

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.667059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.667059Z digest=sha256:7312df04ed9e7613f5e71b56dfc864fe55411bbe159d5d876258b8d06272ee11

Observation 7ed7787b-ed82-49ae-9e66-846a8d6348ed · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.669715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.669715Z digest=sha256:1aa1f880ab71d4602a56f5016e201383154758c2fa56074ce77bff028e8eaf1d

Observation 5bbae5f3-6a6e-4388-ae67-6029fe8ad69a · outbound

This paper cites Star: Self-taught reasoner bootstrapping reasoning with reasoning.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Star: Self-taught reasoner bootstrapping reasoning with reasoning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.427766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.672549Z digest=sha256:9af6039ca2a29eed398b24a6144c3080cce94824dc0a1b9052421655537bd3b1

Observation e06a5064-bf7a-4a76-b3ef-2bab70a4aafa · outbound

This paper cites Least-to-Most Prompting Enables Complex Reasoning in Large Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.676271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.676271Z digest=sha256:1372c2102ea59754b6b9db889af2ab5400ac7db86aa5fbdc9dcd7ae7ec233f7e

Observation 7d3b7e95-806d-40bb-8b0a-78b2baf192ec · outbound

This paper cites React: Synergizing reasoning and acting in language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models React: Synergizing reasoning and acting in language models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.680112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.680112Z digest=sha256:838118e240c44145c617ad756cc3a1a8c29e186270ff7edc2b803c47ad0754e1

Observation 9d7f7b60-f742-4ed4-8262-538aa0aa21a9 · outbound

This paper cites Debiasing in-context learning by instructing llms how to follow demonstrations.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Debiasing in-context learning by instructing llms how to follow demonstrations

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.412777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.683542Z digest=sha256:843a479111a44f3524efa5780cfcaba217e8cce7e2666b055338ccc57cf57efa

Observation 568a757c-58f2-439f-9301-512f20c93783 · outbound

This paper cites Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.686346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.686346Z digest=sha256:ada8963f1c07582d31888d54401f3b9236ed7bc7e8e1760479150effdfb930b4

Observation 46c97963-d8cb-490f-b595-6a688a93b16c · outbound

This paper cites Prompt sketching for large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Prompt sketching for large language models

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.403188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.689179Z digest=sha256:5900177f9b524b739af001504a4c876c69dd2061bc52880bc66e6575ee42be71

Observation 25ae7ea6-21e6-4729-a55d-f3fa6c05b86a · outbound

This paper cites Self-refine: Iterative refinement with self-feedback.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Self-refine: Iterative refinement with self-feedback

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.691864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.691864Z digest=sha256:9ea1005224ebd6bbca45a59726596496ef47e75781bc1cdbfb11368afb96a863

Observation 88a31bde-6223-435b-90a9-6c6349be6b86 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.694535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.694535Z digest=sha256:380ccc73da96c108633d3bd710e124ab23331a22daba03fecc6dc0094b2ae809

Observation 74233023-f874-45d8-8741-9eebd5e2d606 · outbound

This paper cites Neurologic decoding:(un) supervised neural text generation with predicate logic constraints.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Neurologic decoding:(un) supervised neural text generation with predicate logic constraints

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.389274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.697124Z digest=sha256:a354351a84c41d5980c82cc89be483bb0b599dcc9d65086c70948ee9be5d2805

Observation fe1876f5-78d7-4d4c-b641-4d40858ffdf3 · outbound

This paper cites Calibration of pre-trained transformers.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibration of pre-trained transformers

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.379919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.699431Z digest=sha256:231a4647a4b725ecd6fe42d237b2315b63e623561a638f6937324c72940eb1f4

Observation 5ceeb87a-9260-4404-b871-4ed2589f7ac2 · outbound

This paper cites Calibrate before use: Improving few-shot performance of language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibrate before use: Improving few-shot performance of language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.701730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.701730Z digest=sha256:5e882cd9aa5444b58762016a29e40f5d11f85b514e611b9bbf5fa26ebcb634f4

Observation 5f4750a8-0d4e-46bd-9a14-32a3ef571d81 · outbound

This paper cites Calibrating language models with adaptive temperature scaling.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibrating language models with adaptive temperature scaling

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.365364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.704480Z digest=sha256:db0a7acc908193b51d399e8f8eb326cf5c5c104c21eea15d60f3e2b40b62f07c

Observation 291e6d06-dc20-49f7-91ee-40bff5409dc0 · outbound

This paper cites Calibrating large language models with sample consistency.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibrating large language models with sample consistency

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.356435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.707052Z digest=sha256:47395b29b0f832662b3fc4569e753d1b3c645b40aa0496c849693dffd389ca04

Observation f28128f1-d3a7-4447-b8ad-b0a4c509c41b · outbound

This paper cites Benchmarking uncertainty quantification methods for large language models with lm-polygraph.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Benchmarking uncertainty quantification methods for large language models with lm-polygraph

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.347645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.709284Z digest=sha256:81cc365eb657ab34718963677e9da7df47aa9fb992b3345eb0c50cabf0e2a1bd

Observation c7ad5102-cabb-474c-b834-4c0c79213041 · outbound

This paper cites Thermometer: towards universal calibration for large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Thermometer: towards universal calibration for large language models

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.338319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.711759Z digest=sha256:b1d846e8389f8056558f1cb92f5357ca98d08670cc538f0066c1ea523fa32630

Observation 981f2f23-405a-4692-a00e-7f33bd4543e3 · outbound

This paper cites Monte carlo temperature: a robust sampling strategy for llm’s uncertainty quantification methods.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Monte carlo temperature: a robust sampling strategy for llm’s uncertainty quantification methods

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.329636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.714104Z digest=sha256:daee40be08a48f24df7cb552e89f64d159a504e932e818266fb70f677c88750a

Observation 30a565e2-2bc1-44e8-947c-a349b0dbe6b3 · outbound

This paper cites Charm: Calibrating reward models with chatbot arena scores.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Charm: Calibrating reward models with chatbot arena scores

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.716462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.716462Z digest=sha256:b970f57de8c2bc4402037ff8861cf4ee3d4941d1ce5da02bcda572fb067888c3

Observation 8941c8ba-16f9-438b-9dcb-e1edbbcd7d68 · outbound

This paper cites Restoring calibration for aligned large language models: A calibration-aware fine-tuning approach.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Restoring calibration for aligned large language models: A calibration-aware fine-tuning approach

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.719088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.719088Z digest=sha256:38e4a183c3def2b73bd0c892e0fb73851b68f45fee37e7e796eceae883d097db

Observation 54a0abea-7d07-4838-bc15-dd125385f050 · outbound

This paper cites Uncertainty estimation in large language models to support biodiversity conservation.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Uncertainty estimation in large language models to support biodiversity conservation

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.321254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.721589Z digest=sha256:39f9c3e76e2e5a2084652f84b830d3aad7c843c4cfe70c26ceab1187622829ef

Observation c4da330a-b34e-4de7-b732-7b850c1a77d2 · outbound

This paper cites Evaluating Large Language Models in Theory of Mind Tasks.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Evaluating Large Language Models in Theory of Mind Tasks

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.724363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.724363Z digest=sha256:acd7ddc3f1fdb665615a8404f8874ce60a896f92c07bc517397dd80e2b1b1ae6

Observation 45e80a02-291f-45f8-af0f-f452ba01f3b9 · outbound

This paper cites Neural theory-of-mind? on the limits of social intelligence in large lms.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Neural theory-of-mind? on the limits of social intelligence in large lms

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.311892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.727107Z digest=sha256:e0643505170a24d628fa59588930c8eb32c659206419c369a7ca49415ef2bed7

Observation 3732c923-91aa-4618-9630-d810928a1e8b · outbound

This paper cites Social iqa: Commonsense reasoning about social interactions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Social iqa: Commonsense reasoning about social interactions

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.303710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.729494Z digest=sha256:97e87217402237d66299d133e5699fd73841e566d919417d4835f26d03702d5b

Observation f6ae2707-9ad2-4811-ade7-46f523ba93a3 · outbound

This paper cites Large language models are not strong abstract reasoners.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models are not strong abstract reasoners

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.295120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.732181Z digest=sha256:d5f193439443b1f4a52f82babd7146174752e3dcc43ce5ecd30a470594cfac42

Observation 0c5f58cd-35f4-43ac-a61b-3680e204b522 · outbound

This paper cites Coglm: Tracking cognitive development of large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Coglm: Tracking cognitive development of large language models

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.285900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.734531Z digest=sha256:4f54503b946abd9c06a271350870f1c48ed1e1cbe7d4193f13ebc67f12353501

Observation 51baff84-0779-4c6e-9fb3-16938bc28486 · outbound

This paper cites V-alphasocial: Benchmark and self-reflective chain-of- thought generation for visual social commonsense reasoning.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models V-alphasocial: Benchmark and self-reflective chain-of- thought generation for visual social commonsense reasoning

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.277771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.736943Z digest=sha256:df54872074908b0020e00b10ff3c4b57fcaceb94a6287a0524b095275d895196

Observation 627a74e2-98d7-42b2-929e-0df52d2e2100 · outbound

This paper cites Mind2web: Towards a generalist agent for the web.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Mind2web: Towards a generalist agent for the web

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.739479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.739479Z digest=sha256:932a0516f2dc5c2afa49ee18d70ddd6fb7e896a79800019945fab70c7524784c

Observation 7592be3c-8ba4-4e30-8d6d-1e4ef8e92ddf · outbound

This paper cites Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.742049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.742049Z digest=sha256:a93d67cc02cc03d038d9cd2e7b3d286129c7fe22d64b83018940cbefd8e6bc8d

Observation 7bed5f91-00c3-4549-b38e-a7350617a961 · outbound

This paper cites Long Range Arena: A Benchmark for Efficient Transformers.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Long Range Arena: A Benchmark for Efficient Transformers

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.745219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.745219Z digest=sha256:e2257e3ba437c54c83cc94d0fefde31e84b24ed1d9e07a7bd33608c9d060accf

Observation 91e16ef8-01f0-4903-8d7c-ca63f47db4b5 · outbound

This paper cites Minerva: A Programmable Memory Test Benchmark for Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Minerva: A Programmable Memory Test Benchmark for Language Models

Reference 68

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:42.847863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.748430Z digest=sha256:2e108e24fc0676e9003f041b8b968a9ce1074ba055652eb1d2c854e790abe6ce

Observation 0b7abe6e-7add-4c05-9ba7-0a785830c544 · outbound

This paper cites L-eval: Instituting standardized evaluation for long context language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models L-eval: Instituting standardized evaluation for long context language models

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.264284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.751816Z digest=sha256:69025b8a20eeedce879bc68b17b448d88015fc761b7332d1cfc9db7a329bd415

Observation af100c43-3815-4d90-a3df-597d7498c86d · outbound

This paper cites Needle in the Haystack for Memory Based Large Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Needle in the Haystack for Memory Based Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.754635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.754635Z digest=sha256:38085e5b96d00a5f4ec3b997794b6fa961b6ddf01bce9cee94f55fd8e3d120a8

Observation a3c961f2-fb53-4177-96d8-a6b899f08052 · outbound

This paper cites Conversational AI Powered by Large Language Models Amplifies False Memories in Witness Interviews.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Conversational AI Powered by Large Language Models Amplifies False Memories in Witness Interviews

Reference 71

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:42.825972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.757628Z digest=sha256:30f75dedf755903209cc99fad6042b046400b38478e03cf401f4acf2b9ff77d1

Observation 15d3363f-d81e-4c91-ab3b-69513f717179 · outbound

This paper cites Sentence-bert: Sentence embeddings using siamese bert-networks.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Sentence-bert: Sentence embeddings using siamese bert-networks

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.255832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.760596Z digest=sha256:0dccedfc50531027a25c57d5184ef35bdce0049b8b74c8144dd3587687250bb1

Observation e5677550-9e97-4b0e-9fda-11a30c4b5b32 · outbound

This paper cites Introduction to information retrieval , volume 39.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Introduction to information retrieval , volume 39

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.246950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.763686Z digest=sha256:0d71fd1d39e9436d8d03a6429712058ac73749bccb78d9b999a82bd77a73d583

Observation c7c6cf1c-fa05-4c7a-9208-b05183f4260b · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models The claude 3 model family: Opus, sonnet, haiku

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.237288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.766616Z digest=sha256:5b8916d2a5ecff722b60a38d56d907b44dd1511871a101a5da9b1130d8360efd

Observation e6138f8e-1207-4806-a43c-7e73eb63aefa · outbound

This paper cites Model card addendum: Claude 3.5 haiku and sonnet.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Model card addendum: Claude 3.5 haiku and sonnet

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.229332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.769395Z digest=sha256:658e55684b0472ada10d91a2506180f51bac5c9ebc86cec4d49e67c41c44d8c1

Observation 8918cd5d-be6f-4bd8-b8f9-282fccf6cdc2 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.772324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.772324Z digest=sha256:e536d17e0c9d3eae5d456bc8edade360f6ba0d2d9a3ee01fc1f7d84e87939df4

Observation e4eee62f-382c-4feb-ad6a-30862ead2565 · outbound

This paper cites Introducing meta llama 3.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Introducing meta llama 3

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.221259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.775275Z digest=sha256:3e47d614057f24a3316549c5f466567d0868927364cc5bead2381aeb65f0e03e

Observation de7165fe-97ad-4746-84c9-0e7cb86218a3 · outbound

This paper cites The serial position effect of free recall.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models The serial position effect of free recall

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.213126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.778207Z digest=sha256:ade147fbd39236bf5401293cb8d01737e8c4f0d3f9199b3df59d07dab241ea40

Observation 1e0237f2-0b8c-4141-b590-1b0b2faa909c · outbound

This paper cites luck-free.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models luck-free

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.203784Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T14:45:42.780856Z digest=sha256:ffea5bfa7b9b27e55d5b1011b0d6d840b189f85540e1b1176185859a324cf52f

Pith citing papers

Observation 0c7b0f32-2814-431a-9a24-54afd8f992c0 · inbound

Rethinking Query Optimization for Multi-Agent Systems [Vision] cites this paper.

Rethinking Query Optimization for Multi-Agent Systems [Vision] SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T17:21:27.531024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T17:21:27.531024Z digest=sha256:1b54f4e054ace29aa5a6d1a4fd02ea9b7941dbbf4ee98e8bde641fb8e92141a4