Pith. sign in

Paper Citation Record · LEDGER

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2608.05246.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.05246 v1

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T17:17:53.524604Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

51 of 51 outbound references displayed

  • verified exact2
  • verified fuzzy17
  • unresolved29
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cbe5b08b-a1a0-4570-84a2-5ea7da5335df · outbound

This paper cites Learning to reason for multi-step retrieval of personal context in personalized question answering.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Learning to reason for multi-step retrieval of personal context in personalized question answering

Reference 1

Resolution
metadata mismatch
raw_fallback, observed 2026-08-08T17:17:54.748244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.272051Z digest=sha256:8eebdc87da982e6e07622db6c70dcf2caa60d75b13b1f595ce7935ad4cfdc899

Observation 79ad8bfc-f4b9-429c-8877-4842ba5b5e35 · outbound

This paper cites Large language models empowered personalized web agents.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Large language models empowered personalized web agents

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.277727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.277727Z digest=sha256:91046cd4a7dea22ef96521f13f36db98cfef1aa26c3d5c7e3d59695a1e8891c0

Observation 6b6bc56a-3184-44fe-a44e-f73234dc6201 · outbound

This paper cites Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.283149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.283149Z digest=sha256:786cc6a5c2df1d6064515fe9471dff27b4fd1817cabd53885121c642c93bfac6

Observation 05ac2751-17c0-4bf0-90b6-984eefa4c23c · outbound

This paper cites KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.289378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.289378Z digest=sha256:82f8936fa27aac24845d83e1edcf57570aac4aa30bd0c26209059fe9aecf7c60

Observation 647d158d-7195-422d-87bc-e353944c7d53 · outbound

This paper cites POPI: Personalizing LLMs via Optimized Natural Language Preference Inference.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs POPI: Personalizing LLMs via Optimized Natural Language Preference Inference

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.294909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.294909Z digest=sha256:c2db436110ea1e7367c3f7a87c5e76523f6a39497aac69cd357003f50ec2db98

Observation 5fa22ae1-bd35-49d5-a584-db57a9fdf609 · outbound

This paper cites Lifebench: A benchmark for long-horizon multi-source memory, 2026.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Lifebench: A benchmark for long-horizon multi-source memory, 2026

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.301349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.301349Z digest=sha256:017a08528ab38b75139e178a3b7e9a742004bb3285b29274e0d718231866a44e

Observation d566f43c-52a3-489b-b7d7-a44398374f6c · outbound

This paper cites Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.306961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.306961Z digest=sha256:6ffc0487badd8b1f0c61a65f7436dc93f592ec9e97a07c409d48957b7dd8c5a1

Observation 1f13e3a0-abd7-4c66-8078-1ab509693913 · outbound

This paper cites Lifesim: Long-horizon user life simulator for personalized assistant evaluation.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Lifesim: Long-horizon user life simulator for personalized assistant evaluation

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.125871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.312072Z digest=sha256:4732929f268861877b9a26af10de009347c218d09ea429d8fea549ecf60f919f

Observation 015c68cd-1c79-4cd7-87f4-2dc8ef03ff31 · outbound

This paper cites A survey on personalized alignment—the missing piece for large language models in real-world applications.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs A survey on personalized alignment—the missing piece for large language models in real-world applications

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.104016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.316730Z digest=sha256:ce09572b52b76be316699f6ba4f4e1721283ca7eade9cf4baf6bf8363995cd26

Observation 2f3e4e44-ae26-4184-bf7f-b33dbd09a03a · outbound

This paper cites Towards realistic personalization: Evaluating long-horizon preference following in personalized user-llm interactions.arXiv preprint arXiv:2603.04191, 2026.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Towards realistic personalization: Evaluating long-horizon preference following in personalized user-llm interactions.arXiv preprint arXiv:2603.04191, 2026

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.321693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.321693Z digest=sha256:197299d1311d4e81627e915c6bda0d50e9a7927eac49c42775a4302edb6e4ebf

Observation 5a833f00-6104-4aff-8872-1a955379b6ea · outbound

This paper cites Computing inter-rater reliability and its variance in the presence of high agreement.British Journal of Mathematical and Statistical Psychology, 61(1):29–48, 2008.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Computing inter-rater reliability and its variance in the presence of high agreement.British Journal of Mathematical and Statistical Psychology, 61(1):29–48, 2008

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.327020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.327020Z digest=sha256:f2ea5ce4e7199f0271b2041159518ca2739e3851099460026dfe543783271e1d

Observation 4e65dcc8-0313-48e6-ba2f-143f54d7cea1 · outbound

This paper cites Rap: Retrieval-augmented personal- ization for multimodal large language models.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Rap: Retrieval-augmented personal- ization for multimodal large language models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.074174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.331856Z digest=sha256:6b712b11d53c677b5e1e853d6fde32a9e0ae547483227ad3629b78d9ac61870d

Observation 56da7c87-ee3c-4df9-b752-e35cd45242dc · outbound

This paper cites Asking the Right Questions: Improving Reasoning with Generated Stepping Stones.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Asking the Right Questions: Improving Reasoning with Generated Stepping Stones

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.336566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.336566Z digest=sha256:7d896a832f56473a4802eceb4290e80031f15f4cd588bd2593fb07cc7b436e27

Observation 587f4df2-c4fc-4f95-8a4f-e51722811664 · outbound

This paper cites Op-bench: Benchmarking over-personalization for memory-augmented personalized conversational agents.arXiv preprint arXiv:2601.13722, 2026.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Op-bench: Benchmarking over-personalization for memory-augmented personalized conversational agents.arXiv preprint arXiv:2601.13722, 2026

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.342011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.342011Z digest=sha256:093f8c6b9bd0134517c26bd9b334895e35e37cd17d102bc45558aeff20316c89

Observation 26d5f4ea-1045-4c42-a35a-452f625912d9 · outbound

This paper cites Mem-pal: Towards memory-based personalized dialogue assistants for long-term user-agent interaction.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Mem-pal: Towards memory-based personalized dialogue assistants for long-term user-agent interaction

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.056133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.346834Z digest=sha256:ef0dc4c9d953b9e478bd1970cc6d2d53d1a69523781681a34985edd6ea5c9d0f

Observation fc44df1e-9e30-44e3-8dea-6c4ea85bddbd · outbound

This paper cites Taylor, and Dan Roth.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Taylor, and Dan Roth

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.352101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.352101Z digest=sha256:cc60ba271773fad7ddd6fdff06ba227977151d441c45436f481e255eeb99c811

Observation 09fed038-012f-4d9a-a4e7-d0b7da1e84b5 · outbound

This paper cites Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.356534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.356534Z digest=sha256:f104495b2ea30d1ec3fcdcee7be38b41c9dac1b8d1c78b7157289a0bfb7cd6bf

Observation 1761f197-9cf5-44b7-9579-ff4770ea77d5 · outbound

This paper cites Humanllm: Towards personalized understanding and simulation of human nature.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Humanllm: Towards personalized understanding and simulation of human nature

Reference 18

Resolution
metadata mismatch
raw_fallback, observed 2026-08-08T17:17:54.163090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.361281Z digest=sha256:8525eff852a2cacf9a2e2503f7ceebf4b288e3d7eb95359852e92b07379ac0ec

Observation 3df11aa5-64a0-4e50-9c98-4ab4a69a979f · outbound

This paper cites Retrieval-augmented genera- tion for knowledge-intensive nlp tasks.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Retrieval-augmented genera- tion for knowledge-intensive nlp tasks

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.039109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.366074Z digest=sha256:8c3659a15c437c36d78ece20a0867059cd65aad63ea682bcd6e10e9fc0da72eb

Observation 0ec4ee73-f0bd-48d8-b716-81e5dd09304c · outbound

This paper cites Can llm agents simulate multi-turn human behavior? evidence from real online customer behavior data.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Can llm agents simulate multi-turn human behavior? evidence from real online customer behavior data

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.021118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.370929Z digest=sha256:532bddaff2edc40d1d8b815685587e0931fc6e9bff49b11b276ed4eba4bffaa2

Observation 1f0c53b9-6e91-4f50-94c1-229004c058e5 · outbound

This paper cites Exploring the potential of LLMs as person- alized assistants: Dataset, evaluation, and analysis.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Exploring the potential of LLMs as person- alized assistants: Dataset, evaluation, and analysis

Reference 21

Resolution
verified exact
doi, observed 2026-08-08T17:17:53.595425Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.375836Z digest=sha256:0a1c5479cd368261cc6db90f59d6df9523aa2eec08e5c1ee6ed801e21898244f

Observation d126780d-3f88-4567-a0a9-0fda6c6b59fc · outbound

This paper cites Privacybench: A conversational benchmark for evaluating privacy in personalized ai, 2025.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Privacybench: A conversational benchmark for evaluating privacy in personalized ai, 2025

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.380675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.380675Z digest=sha256:f6e452a03d955779cef2d9ed6a1f24ae5425ab9b1e5d92dc31abded266d9db8a

Observation ad1f9ba3-504a-4ab0-8a64-429516c6ef1e · outbound

This paper cites PersonaVLM: Long-Term Personalized Multimodal LLMs.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs PersonaVLM: Long-Term Personalized Multimodal LLMs

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.385274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.385274Z digest=sha256:a6884255a53639ca77c09361805f46437f13a94a2269efc71c55c7ea9c00a6b3

Observation cb7d46fd-ed79-4425-ae21-9c923116454c · outbound

This paper cites On Memory Construction and Retrieval for Personalized Conversational Agents.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs On Memory Construction and Retrieval for Personalized Conversational Agents

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.390227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.390227Z digest=sha256:a27d9b1bc58dfe3e7cd73ff263b292d7fe151270c18971a61b88c305361f2d89

Observation a2e0a7b9-8a7c-4286-a73a-a35006f2af53 · outbound

This paper cites LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.395160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.395160Z digest=sha256:d6ca40481384a70ef39973551d999c1f8b33db7cb28bdaed99654e1e056de76c

Observation c4df0f79-a0e7-40ed-aa7c-a6b0fc3768e0 · outbound

This paper cites Lamp-qa: A benchmark for personalized long-form question answering.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Lamp-qa: A benchmark for personalized long-form question answering

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:55.003847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.400822Z digest=sha256:7b043d67512c85a2be5b8962e8c337f132f69ddfddc9b547f132097079f7b6d7

Observation b7cb8012-50dc-419e-bf7d-a489e1e3d0e5 · outbound

This paper cites Optimization methods for personalizing large language models through retrieval augmentation.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Optimization methods for personalizing large language models through retrieval augmentation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.405758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.405758Z digest=sha256:7c42f9cc3aebdda7bf48cd452f3b49ef6c020158ebe1bb5c7cc321a194e38cc9

Observation 636e4262-22b5-469c-be69-20b8decfc0c2 · outbound

This paper cites Lamp: When large language models meet personalization.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Lamp: When large language models meet personalization

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.987973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.410357Z digest=sha256:ab7fb0a62f17772f95cbb44f7ae83379eccd312152239f8902ffe37536c5f140

Observation 63cdc21d-4945-41e9-b83a-2d50e16f610b · outbound

This paper cites PersonaBench: Evaluating AI models on understanding personal information through accessing (synthetic) private user data.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs PersonaBench: Evaluating AI models on understanding personal information through accessing (synthetic) private user data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.414867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.414867Z digest=sha256:66cade5a24e2aac4dccc9ebdb73c2e9a4416787106bc91dc6dcecf076ca83614

Observation ad19aebd-878a-49c0-a267-9cf724497249 · outbound

This paper cites Democratizing large language models via personalized parameter-efficient fine-tuning.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Democratizing large language models via personalized parameter-efficient fine-tuning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.961165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.419312Z digest=sha256:a9a2ac4be11634882cdc91ae671209555a853696d8d08e6741b1acd4b265417c

Observation 5e34d33a-f1a6-4e94-88bc-38449f3a8511 · outbound

This paper cites In prospect and retrospect: Reflective memory management for long-term personalized dialogue agents.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs In prospect and retrospect: Reflective memory management for long-term personalized dialogue agents

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.945799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.424373Z digest=sha256:431b368cd0b433de07fb6f52d340f0d117ca9e5c8fc5749240ceb289ae2dadb7

Observation cba440d3-9b69-45e2-a3f3-0aa57e8bb554 · outbound

This paper cites PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.434087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.434087Z digest=sha256:8c3072ef716e7a4160810c8d3d92a0595dfe703621aee3109c76e78871d3459a

Observation d24e8727-09ee-4441-ab20-6213f38d17de · outbound

This paper cites OPeRA: A dataset of observation, persona, rationale, and action for evaluating LLMs on human online shopping behavior simulation.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs OPeRA: A dataset of observation, persona, rationale, and action for evaluating LLMs on human online shopping behavior simulation

Reference 33

Resolution
verified exact
doi, observed 2026-08-08T17:17:54.930558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.438950Z digest=sha256:021a6356dd4b8394a3551a3dcd728a02979a795b9926c26e7df03adf908993d7

Observation d7cabc12-5fd3-4ad5-9e9c-693f2d03cd75 · outbound

This paper cites Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.443925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.443925Z digest=sha256:7db45b7034db0de5c2c1449ffd75ce383f3e457a779840dd941534dcae3fe893

Observation 1636cc8f-8755-4d64-a7a7-2d33cc89459b · outbound

This paper cites DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.448806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.448806Z digest=sha256:958ce83880fab9d2914dcb4ffabf2802fa9de308779118ff720759f8e9c3cf61

Observation 294eab45-e44f-4b36-b70a-debc93e08f27 · outbound

This paper cites Lauvrak, Jon Atle Gulla, and Heri Ramampiaro.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Lauvrak, Jon Atle Gulla, and Heri Ramampiaro

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.913126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.453682Z digest=sha256:54572a4904c0f351ca69ae8ed37a1416bea1ba95c1f5f3306021d914a5c9b5d5

Observation d87058c1-ad0c-498c-956d-3ab710d15acf · outbound

This paper cites an unresolved cited work.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.459192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.459192Z digest=sha256:49ee8324b2c700e616bc00bc0c1ddbf179aea940d93080f3d5d235cea58ad339

Observation 19ce0ba7-0d2c-4154-8a0b-359a578a26b8 · outbound

This paper cites Promax: Exploring the potential of llm-derived profiles with distribution shaping for recommender systems.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Promax: Exploring the potential of llm-derived profiles with distribution shaping for recommender systems

Reference 38

Resolution
metadata mismatch
raw_fallback, observed 2026-08-08T17:17:53.739143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.464402Z digest=sha256:07a29fb7026914eedc36b4c92d5c5e858215188f8369b88cf49f3d5da33daa7e

Observation adffac51-bba2-4278-aec2-65d48b3e81bd · outbound

This paper cites Do LLMs Recognize Your Preferences? Evaluating Personalized Preference Following in LLMs.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Do LLMs Recognize Your Preferences? Evaluating Personalized Preference Following in LLMs

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.469368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.469368Z digest=sha256:1c4d2708d3ce096552b72fdffb9ad009431397f167e9788e07c318208f464a49

Observation d0a33fd7-19bc-4d37-b060-191a6d177e0e · outbound

This paper cites Cohen, and Emine Yilmaz.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Cohen, and Emine Yilmaz

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.474220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.474220Z digest=sha256:92f8cd98d79906f8a4310a8cc7998ff791f962d9cf1a04de8375c72adda374dc

Observation 3bef6ec4-4c44-4604-9663-e53fa6a84e70 · outbound

This paper cites Cantonese cuisine.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Cantonese cuisine

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.479258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.479258Z digest=sha256:f93902b7c01073ed5cb1724d5505204b0ce52f4f8e5ecd3b15ceb622247e3f4a

Observation 46159ad9-2549-44f9-819d-091c4950fd99 · outbound

This paper cites You tend toward budget-conscious choices.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs You tend toward budget-conscious choices

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.896381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.485499Z digest=sha256:8ec306338cc3fcd975595f1a16a6e04a5e5aaeddb8c591cf8b192fbadde93a40

Observation cbacb1d9-02bc-4d7d-911f-7b2fd1fbb502 · outbound

This paper cites Note that cross-domain references serving the response are legitimate; offense occurs only when references are purely demonstrative.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Note that cross-domain references serving the response are legitimate; offense occurs only when references are purely demonstrative

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.880274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.490402Z digest=sha256:b72ec941ac4f990080f3f1cc63786788c87d0a58ed4f52460a3a3a38a6eb1e89

Observation 91dd12f4-3f53-478f-99a7-0b60caec758d · outbound

This paper cites educate" the user, such as.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs educate" the user, such as

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.863931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.495608Z digest=sha256:1129d84b181064c025cea262bc2edcd367cd9904af7b82cb5bcca54d7ce8e20d

Observation 8d064032-1750-4f6c-9512-85b3a0f62214 · outbound

This paper cites an unresolved cited work.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-08T17:17:54.848030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.500517Z digest=sha256:dd9753def66659a263ea08841ced54af82b4455a9a38762c33e0407d31b69534

Observation ad1790ac-5891-4b0f-ad40-1fab75938661 · outbound

This paper cites an unresolved cited work.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-08T17:17:54.830944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.505050Z digest=sha256:3ff2d69f23332b14bbdbbc2b40c88d5e76d46735ac1be7557fb45617c17602bb

Observation 177d19fa-f24d-4b90-bd51-6c8034977286 · outbound

This paper cites retrieval.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs retrieval

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.815062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.509773Z digest=sha256:4ade5eed2eb0f80085aba95ba85ca63997e21ef81e9d7fd9963187d7e764af68

Observation c704c8f8-0641-4b77-8a85-e02176aefcae · outbound

This paper cites swap test.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs swap test

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.799387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.515287Z digest=sha256:35a9371b147b05801addaaa754658429ccf9744c68b9981e954d349c31296f2d

Observation f44d3304-2982-4065-862d-6d738a01164c · outbound

This paper cites an unresolved cited work.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-08T17:17:54.781914Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.519873Z digest=sha256:2199d06ea699317e400747c688e6f922d13e4dc7cef345208924d396b81468f1

Observation 7f5c301d-97ed-471f-a7b4-055c5b9993f3 · outbound

This paper cites retrieval.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs retrieval

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:17:54.765834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T17:17:53.524604Z digest=sha256:5107813b20ef3354f537d65ea50cec545a456e79a7f6d26e96742fc53f02e3a2

Observation 0e0385c0-3997-4f02-8d7f-73c7f45ff40a · outbound

This paper cites ISBN 979-8-89176-251-0.

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs ISBN 979-8-89176-251-0

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-08T17:17:53.429103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:17:53.429103Z digest=sha256:4bbf95036cf64045bcf063ed8852205e08643b75a42ee7b2a8b75611f2802dbc

Pith citing papers

No inbound Pith citation observations are available.