{"as_of":"2026-08-21T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94f30b3992bd370cbe892b4480b418c5bf1642aa5064f01ae289dfd44c4d4810","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:54:06.092545Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:03:37.442512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:57:23.584256Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-08-07T15:43:19.367275Z","title":"Lore: Personalizing llms via low-rank reward modeling.arXiv preprint arXiv:2504.14439, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14106","last_updated":"2025-05-25T18:28:20Z","snapshot_observed_at":"2026-08-14T03:46:31.257528Z","submitted_at":"2025-05-20T09:13:22Z","title":"A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:19.367275Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2505.14106"},"observation_digest":"sha256:898a7b67325e7cc2a3202c31f21b50285be132ad0991f4756d87818532aeee29","observation_id":"a903f797-26e0-48dc-b27f-1e35298c32d9","resolution":{"observed_at":"2026-08-07T15:43:19.367275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":"2504.14439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-07-02T20:57:23.584256Z","title":"Bose, A., Xiong, Z., Chi, Y ., Du, S","venue":null,"work_id":"2c2b5484-67cd-4846-af0e-f59f3b7ebee4","year":2025},"citing_paper":{"arxiv_id":"2506.05967","last_updated":"2025-06-06T10:45:42Z","snapshot_observed_at":"2026-08-13T19:44:14.868083Z","submitted_at":"2025-06-06T10:45:42Z","title":"Preference Learning for AI Alignment: a Causal Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T11:22:02.986033Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2506.05967"},"observation_digest":"sha256:96b1793a01af3c847e408cd635fb150d3785c71d98d06bf49cbda4e181ade4b1","observation_id":"ea4d2761-f2f0-4393-b499-bf9afbc11de8","resolution":{"observed_at":"2026-05-19T11:22:16.435571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":"2504.14439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-07-02T20:57:23.584256Z","title":"Bose, A., Xiong, Z., Chi, Y ., Du, S","venue":null,"work_id":"2c2b5484-67cd-4846-af0e-f59f3b7ebee4","year":2025},"citing_paper":{"arxiv_id":"2510.17881","last_updated":"2026-04-24T20:38:37Z","snapshot_observed_at":"2026-08-10T21:32:03.018544Z","submitted_at":"2025-10-17T23:07:57Z","title":"POPI: Personalizing LLMs via Optimized Natural Language Preference Inference","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:41:58.231139Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2510.17881"},"observation_digest":"sha256:1214fdb0aebcf698aebb0d2057e99ec01c5b518ac54a381917b0320b48951804","observation_id":"1c4b4c45-1162-4a68-aaa7-3627c71f13cc","resolution":{"observed_at":"2026-05-18T05:42:24.423865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":"2504.14439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-07-02T20:57:23.584256Z","title":"Bose, A., Xiong, Z., Chi, Y ., Du, S","venue":null,"work_id":"2c2b5484-67cd-4846-af0e-f59f3b7ebee4","year":2025},"citing_paper":{"arxiv_id":"2604.05460","last_updated":"2026-04-07T05:44:08Z","snapshot_observed_at":"2026-08-20T03:40:55.552906Z","submitted_at":"2026-04-07T05:44:08Z","title":"LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T19:39:49.792609Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2604.05460"},"observation_digest":"sha256:aacb4f4a4e53ca528d83a2b581ec4f6120a06301fdd21687713b29570489a4f8","observation_id":"aa7e733a-bcb4-4678-b3b2-871a213e889e","resolution":{"observed_at":"2026-05-10T22:40:49.004582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":"2504.14439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-07-02T20:57:23.584256Z","title":"Bose, A., Xiong, Z., Chi, Y ., Du, S","venue":null,"work_id":"2c2b5484-67cd-4846-af0e-f59f3b7ebee4","year":2025},"citing_paper":{"arxiv_id":"2606.02300","last_updated":"2026-06-01T14:23:17Z","snapshot_observed_at":"2026-08-14T16:01:05.005608Z","submitted_at":"2026-06-01T14:23:17Z","title":"Beyond Isolated Behaviors: Hierarchical User Modeling for LLM Personalization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T14:51:27.110839Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2606.02300"},"observation_digest":"sha256:b4f96d12655ebfb61796832edfb8c6799d29438dbeee174a0c4ae63b4e48d2a4","observation_id":"c59bf9d7-60d2-4694-bb6c-789bb9dc1565","resolution":{"observed_at":"2026-07-01T22:56:20.615111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":"2504.14439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-07-02T20:57:23.584256Z","title":"Bose, A., Xiong, Z., Chi, Y ., Du, S","venue":null,"work_id":"2c2b5484-67cd-4846-af0e-f59f3b7ebee4","year":2025},"citing_paper":{"arxiv_id":"2606.07988","last_updated":"2026-06-06T05:35:31Z","snapshot_observed_at":"2026-08-16T12:53:47.269275Z","submitted_at":"2026-06-06T05:35:31Z","title":"PAFO: Pareto Fairness Optimization for Personalized Reward Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T20:00:05.900814Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2606.07988"},"observation_digest":"sha256:32101251d927dd3d484a55211ee21b854dc3a2dea62164a15317c26e48efca54","observation_id":"e83153ec-6383-49ae-9ca9-d9a4c4ab2921","resolution":{"observed_at":"2026-07-02T20:57:23.586152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14439","snapshot_observed_at":"2026-08-07T23:03:37.442512Z","title":"Lore: Personalizing llms via low-rank reward modeling.arXiv preprint arXiv:2504.14439,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05813","last_updated":"2026-08-06T09:45:25Z","snapshot_observed_at":"2026-08-18T00:36:00.944906Z","submitted_at":"2026-08-06T09:45:25Z","title":"Cautious Context Steering for Language Model Personalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:03:37.442512Z"},"links":{"cited_paper":"/paper/2504.14439","citing_paper":"/paper/2608.05813"},"observation_digest":"sha256:ee2d66d95a9f85e67a76d11f0e72ad957f0e2f8a081b7cba6a41ce2ed821bbf4","observation_id":"78095518-2691-4c04-936b-dde539db32b6","resolution":{"observed_at":"2026-08-07T23:03:37.442512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14439/citation-record","integrity":"/paper/2504.14439/integrity","json":"/paper/2504.14439/citation-record.json","paper":"/paper/2504.14439"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:05.763953Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.763953Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:33242a46f8c3fc99b409f3ab2c17d867c2df70bd7db034b099899f46ecda0b5a","observation_id":"ecf0a54b-fd87-4174-92b9-a35be6c03888","resolution":{"observed_at":"2026-08-16T11:54:05.763953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:54:05.768989Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.768989Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:c2ecf9cd9dbb0eca3a2e55da7e4e71701021ee2706c5f59e0b8e8441820f5a08","observation_id":"d399bfb9-26bd-47a1-bffc-0a0f0140d786","resolution":{"observed_at":"2026-08-16T11:54:05.768989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.657431Z","title":"Flambe: Structural complexity and representation learning of low rank mdps","venue":null,"work_id":"47c3bc85-ea40-452e-841a-8e3271de1c4e","year":2020},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.898627Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:8b9dc674d8e92554e90a59d6375de01c20fe28fe4093554169ad1e29db1bbcc8","observation_id":"e9105295-c371-4a3f-b679-62062fe2e96d","resolution":{"observed_at":"2026-08-16T11:54:06.661267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T11:54:05.902914Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.902914Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:e68cc2b6ef137333ec1d12804d2683796c9fb22ecd5d0ca5d697cc0dd0bda05c","observation_id":"73b1d9de-15c3-4d27-b973-0b783d1c941d","resolution":{"observed_at":"2026-08-16T11:54:05.902914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.644686Z","title":"Fine-tuning language models to find agreement among humans with diverse preferences","venue":null,"work_id":"4186f004-ee40-4d2a-b325-9ce55d4a1b1c","year":2022},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.907637Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:eaad43c6e86aa0f0e67112e51adc407481044ccf765975993b83da56cbb9d29f","observation_id":"6a072a21-c696-4576-b5e2-2eba6fa53f40","resolution":{"observed_at":"2026-08-16T11:54:06.648936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.631581Z","title":"Initializing services in interactive ml systems for diverse users","venue":null,"work_id":"841acb80-c790-44f0-952c-961bbad836e6","year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.911975Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:403337a35c80aafea91150cf588c2ceeabb3e7a32c8a5dffb06e32bb2dca7d7f","observation_id":"4b684668-6050-433d-9d0f-39696fea3082","resolution":{"observed_at":"2026-08-16T11:54:06.635930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12570","last_updated":"2024-02-19T21:52:44Z","snapshot_observed_at":"2026-08-18T06:40:52.406992Z","submitted_at":"2024-02-19T21:52:44Z","title":"Offline Multi-task Transfer RL with Representational Penalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12570","snapshot_observed_at":"2026-08-16T11:54:05.915699Z","title":"Offline multi-task transfer rl with representational penalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.915699Z"},"links":{"cited_paper":"/paper/2402.12570","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:fd139f2e5cfb75ae9d3fad8a407f2e2cf47a347643210d427414f2b85607935e","observation_id":"4a0a655c-2dc4-414f-9518-5b358487efb0","resolution":{"observed_at":"2026-08-16T11:54:05.915699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:05.919873Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.919873Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:57a06bace4e1123b8c075dc6c61b1e6d179a21ee81b4a72bc93519104a8f5a47","observation_id":"0fcf749b-26c5-4c0f-9315-7ee6921fc679","resolution":{"observed_at":"2026-08-16T11:54:05.919873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17387","last_updated":"2024-07-24T16:11:39Z","snapshot_observed_at":"2026-08-16T13:31:22.334408Z","submitted_at":"2024-07-24T16:11:39Z","title":"PERSONA: A Reproducible Testbed for Pluralistic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17387","snapshot_observed_at":"2026-08-16T11:54:05.923970Z","title":"Persona: A reproducible testbed for pluralistic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.923970Z"},"links":{"cited_paper":"/paper/2407.17387","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:f4cbe8ba0637432b93b0f530f0f02d9b50fd2588fa4d92bb9ff6f2c6fcaa1868","observation_id":"2546c224-e0dd-4536-82a1-34fac97c789c","resolution":{"observed_at":"2026-08-16T11:54:05.923970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08469","last_updated":"2024-06-12T17:54:54Z","snapshot_observed_at":"2026-08-20T17:23:27.969020Z","submitted_at":"2024-06-12T17:54:54Z","title":"PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08469","snapshot_observed_at":"2026-08-16T11:54:05.928113Z","title":"Pal: Pluralistic alignment framework for learning from heterogeneous preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.928113Z"},"links":{"cited_paper":"/paper/2406.08469","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:3918ce5f3aaf8a9530e798d0b9e416f3785fdaad57d194af2ac7da5a55e16509","observation_id":"272ed6ce-6d50-4c36-84ba-5d039cab456e","resolution":{"observed_at":"2026-08-16T11:54:05.928113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04070","last_updated":"2025-03-13T13:37:57Z","snapshot_observed_at":"2026-08-18T09:03:16.309421Z","submitted_at":"2024-10-05T08:00:55Z","title":"PAD: Personalized Alignment of LLMs at Decoding-Time","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04070","snapshot_observed_at":"2026-08-16T11:54:05.932033Z","title":"Pad: Personalized alignment of llms at decoding-time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.932033Z"},"links":{"cited_paper":"/paper/2410.04070","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:77d6c37d8c2c83983aa866c678f14416a98cff1ed3cb6bc21388e647e7a33237","observation_id":"29c1425a-709c-4f17-902c-3461825f61b2","resolution":{"observed_at":"2026-08-16T11:54:05.932033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:05.936526Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.936526Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:74d3b363b022a70711b2e7186d4f0384863b4298c2fb7623f99cb3cd025f3763","observation_id":"07f6830c-107b-4507-afb7-e34a156802b7","resolution":{"observed_at":"2026-08-16T11:54:05.936526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11657","last_updated":"2024-06-17T15:41:30Z","snapshot_observed_at":"2026-08-16T13:42:12.594496Z","submitted_at":"2024-06-17T15:41:30Z","title":"Can LLM be a Personalized Judge?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11657","snapshot_observed_at":"2026-08-16T11:54:05.940185Z","title":"Can llm be a personalized judge? arXiv preprint arXiv:2406.11657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.940185Z"},"links":{"cited_paper":"/paper/2406.11657","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:fb20b8fa4f55e2ac42a702bb04efdb08a9c6fda4426ffe7b04d3b08e6590e6e3","observation_id":"2a2d977d-04bc-4635-a84d-727dbd7d72ff","resolution":{"observed_at":"2026-08-16T11:54:05.940185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16388","last_updated":"2024-04-12T00:05:53Z","snapshot_observed_at":"2026-08-16T07:30:34.459530Z","submitted_at":"2023-06-28T17:31:53Z","title":"Towards Measuring the Representation of Subjective Global Opinions in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16388","snapshot_observed_at":"2026-08-16T11:54:05.944198Z","title":"Towards measuring the representation of subjective global opinions in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.944198Z"},"links":{"cited_paper":"/paper/2306.16388","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:ade498ca29d5c73ffaa2c6c6af2f3c4beb5e67e1898f64fe6c850b3f02a42b5a","observation_id":"4158e063-c351-437c-8ff1-ba7c81a359db","resolution":{"observed_at":"2026-08-16T11:54:05.944198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-08-16T13:53:40.024766Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-08-16T11:54:05.948101Z","title":"Value augmented sampling for language model alignment and personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.948101Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:ec88dd364b56f2aac973351315340094206e1f5ea8cd30d54853bca8d1e6825b","observation_id":"8c783997-b118-4c07-92a1-28f4c42c5747","resolution":{"observed_at":"2026-08-16T11:54:05.948101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T11:54:05.952191Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.952191Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:ec43f45dd801c52a30af1867b369423aec48f6d1ec0b5ce5cc13b8f53517fa0b","observation_id":"12e45069-22f4-4e29-87e3-ae74d91a6009","resolution":{"observed_at":"2026-08-16T11:54:05.952191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11564","last_updated":"2023-10-17T20:22:13Z","snapshot_observed_at":"2026-08-19T17:50:35.007786Z","submitted_at":"2023-10-17T20:22:13Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11564","snapshot_observed_at":"2026-08-16T11:54:05.955995Z","title":"Personalized soups: Personalized large language model alignment via post-hoc parameter merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.955995Z"},"links":{"cited_paper":"/paper/2310.11564","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:6700b34c7926c0e282d283d8b67f4943cb7770affa0e7971d75392c791b1613c","observation_id":"177894a9-0402-4fd6-b48d-aafc74e811a1","resolution":{"observed_at":"2026-08-16T11:54:05.955995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.603917Z","title":"Evaluating and inducing personality in pre-trained language models","venue":null,"work_id":"7b5a06e7-bdbf-4a68-a141-9b3cc7524448","year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.960429Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:0eb15e108a95041051679fee10942015ff1eb9c6b1089dbb2cd6aae1c78a8dbb","observation_id":"b329dfcb-eaf8-41be-be61-49db1bf9d1e3","resolution":{"observed_at":"2026-08-16T11:54:06.608234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T11:54:05.964109Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.964109Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:7b1b7844c52414e7cd57f8ee5798c59e876ed314b1bf3f1bafe7b3d6af385587","observation_id":"335a34c4-273e-4efb-b9e9-0006750a9b4b","resolution":{"observed_at":"2026-08-16T11:54:05.964109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.591586Z","title":"The benefits, risks and bounds of personalizing the alignment of large language models to individuals","venue":null,"work_id":"ed2e924a-d315-4271-ae11-89c1f3f005de","year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.968349Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:6af3fc17dd2d9c8d128fefae126cfc41249ed235562392636bf8025898ef530c","observation_id":"1a4ad103-f726-4f08-ad07-a6cca18d0967","resolution":{"observed_at":"2026-08-16T11:54:06.595785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16019","last_updated":"2024-12-03T16:18:10Z","snapshot_observed_at":"2026-08-16T18:14:33.796844Z","submitted_at":"2024-04-24T17:51:36Z","title":"The PRISM Alignment Dataset: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16019","snapshot_observed_at":"2026-08-16T11:54:05.971855Z","title":"The prism alignment project: What participatory, representative and individualised human feedback reveals about the subjective and multicultural alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.971855Z"},"links":{"cited_paper":"/paper/2404.16019","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:1cfdb14c58e5e423dbf84ab75148fea9a6847dfd14c516c1b94778ca081fb36f","observation_id":"93b7d558-ade3-418f-9336-d19af72f863d","resolution":{"observed_at":"2026-08-16T11:54:05.971855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:05.977122Z","title":"Matrix factorization techniques for recommender systems","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.977122Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:cc9447a44440a4d6a6615b68737f4aca381c617915ffc8d047654c33c2a1454b","observation_id":"68ab15d1-13d9-4bc3-ac34-0951fa252e90","resolution":{"observed_at":"2026-08-16T11:54:05.977122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06929","last_updated":"2024-08-13T14:32:43Z","snapshot_observed_at":"2026-08-16T13:26:42.688894Z","submitted_at":"2024-08-13T14:32:43Z","title":"Evaluating Cultural Adaptability of a Large Language Model via Simulation of Synthetic Personas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06929","snapshot_observed_at":"2026-08-16T11:54:05.981112Z","title":"Evaluating cultural adaptability of a large language model via simulation of synthetic personas","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.981112Z"},"links":{"cited_paper":"/paper/2408.06929","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:3d00b7edbd2665ac1cb44a7cd89035e8724aaabde3cb660085fbf96e8f3097ab","observation_id":"8377d5c3-a141-483a-9804-041723d24820","resolution":{"observed_at":"2026-08-16T11:54:05.981112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08812","last_updated":"2026-04-19T16:29:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-11T23:02:26Z","title":"Test-Time Alignment via Hypothesis Reweighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08812","snapshot_observed_at":"2026-08-16T11:54:05.985098Z","title":"Test-time alignment via hypothesis reweighting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.985098Z"},"links":{"cited_paper":"/paper/2412.08812","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:5e4bc5d9f1eaf649641b3bf4cbfed4e87eb6b55598bc21ab15e191c12a98844c","observation_id":"d6a0b2b9-bfde-4af9-983b-d7eb48007b6e","resolution":{"observed_at":"2026-08-16T11:54:05.985098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05133","last_updated":"2024-12-09T04:21:08Z","snapshot_observed_at":"2026-08-18T13:49:22.603730Z","submitted_at":"2024-02-06T04:18:58Z","title":"Personalized Language Modeling from Personalized Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05133","snapshot_observed_at":"2026-08-16T11:54:05.989386Z","title":"Personalized language modeling from personalized human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.989386Z"},"links":{"cited_paper":"/paper/2402.05133","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:11772195f71e1af9f22b332ea9b318c2a4e6ba56ca424eabf6669394edc01e41","observation_id":"1aa47a59-427c-4e67-ad8b-f266a9a67c87","resolution":{"observed_at":"2026-08-16T11:54:05.989386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-16T11:54:05.993546Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.993546Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:61282eaca5425671f9e1d78ef7dd5c53e17ee6036c547c0a04a8142ac3f8536d","observation_id":"184c3746-fa6f-4ca7-b058-57e033fe3adc","resolution":{"observed_at":"2026-08-16T11:54:05.993546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.571182Z","title":"Individualized rank aggregation using nuclear norm regularization","venue":null,"work_id":"322b2b34-6110-48ef-a0e5-68e937a5c59b","year":2015},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:05.997546Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:f96464fcb7f4a547ef272a11272295d5367b4f02c7fdb99742c8791330cf8ec3","observation_id":"2d0161a1-d6b8-4999-830b-4e912285901c","resolution":{"observed_at":"2026-08-16T11:54:06.575466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06576","last_updated":"2026-05-10T18:35:10Z","snapshot_observed_at":"2026-08-02T13:21:35.186233Z","submitted_at":"2024-07-09T06:11:18Z","title":"Virtual Personas for Language Models via an Anthology of Backstories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06576","snapshot_observed_at":"2026-08-16T11:54:06.001443Z","title":"Virtual personas for language models via an anthology of backstories","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.001443Z"},"links":{"cited_paper":"/paper/2407.06576","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:9d07f27eb57d1c873645973983bf0fe01baace2dc7a32188e736d70c2657a9c3","observation_id":"abb3ef21-f5da-4df4-96fa-eb2f2090f8e1","resolution":{"observed_at":"2026-08-16T11:54:06.001443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.007535Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.007535Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:06cab2a133712ad731aa5bacf66840d902ff835f4331b74e5c189808ca14b693","observation_id":"f3549ba9-2fb4-4104-b393-5bf2e3269153","resolution":{"observed_at":"2026-08-16T11:54:06.007535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.550918Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":"5a22d5e5-252a-401c-8f79-97466456224a","year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.012883Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:7d9adff40882654d7ac187e60713082ce11fe63d7d0a13e646909e86f2ce823c","observation_id":"425c773c-24a3-440b-80cf-e1d5f7f19165","resolution":{"observed_at":"2026-08-16T11:54:06.555123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.531629Z","title":"Preference completion: Large-scale collaborative ranking from pairwise comparisons","venue":null,"work_id":"c347159d-84ca-49b9-be9d-34f1377bc732","year":1907},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.018237Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:4d817a8a32d25a524638856b7c6b8eb5a2fb5a4f12d16ac9cbc554c4a5fc1a8d","observation_id":"b345a217-bffd-45a1-8d34-4d25666272f4","resolution":{"observed_at":"2026-08-16T11:54:06.535919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-08-16T13:25:29.397694Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-16T11:54:06.022123Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.022123Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:1c077624477710c46f5028f72a58ad1648531b974fc35c372a58cc8ae9269992","observation_id":"77042ddd-8aaf-49e0-96ce-7b22889c7c44","resolution":{"observed_at":"2026-08-16T11:54:06.022123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.026124Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.026124Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:78fe6754b94d2002bee2b70192902446fa135357a08f758c88d04aab0d916e9e","observation_id":"c395793e-182f-4d4e-a0d2-f44fcb5d711c","resolution":{"observed_at":"2026-08-16T11:54:06.026124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.029797Z","title":"Rewarded soups: towards pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.029797Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:0883d219db48790687ddf0e2eaa9911e43f868d39330abfd6a69920cc607d425","observation_id":"5133b998-d4c5-4c5a-9f66-d281e024b579","resolution":{"observed_at":"2026-08-16T11:54:06.029797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.503056Z","title":"Personality traits in large language models","venue":null,"work_id":"dba28a8b-672e-485f-9478-5824cd54549c","year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.033160Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:5e798d7050fca0773d40fff54bd9e4193872879416575dae65b77b96f6f1e2b4","observation_id":"48eddf9c-1cc5-43bc-aebc-155e6341d9c4","resolution":{"observed_at":"2026-08-16T11:54:06.508869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00888","last_updated":"2025-04-18T19:45:34Z","snapshot_observed_at":"2026-08-18T22:28:15.740497Z","submitted_at":"2024-06-02T23:13:56Z","title":"Aligning Language Models with Demonstrated Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00888","snapshot_observed_at":"2026-08-16T11:54:06.037210Z","title":"Show, don't tell: Aligning language models with demonstrated feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.037210Z"},"links":{"cited_paper":"/paper/2406.00888","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:b075a6e0c2be7d6fe8556fbe782211bf9461918314dfa2346bdcdb7b28521732","observation_id":"bdd2785c-06b1-401a-9e49-ddc3613e496e","resolution":{"observed_at":"2026-08-16T11:54:06.037210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18853","last_updated":"2024-10-28T03:23:14Z","snapshot_observed_at":"2026-08-16T13:39:14.018201Z","submitted_at":"2024-06-27T02:46:30Z","title":"Decoding-Time Language Model Alignment with Multiple Objectives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18853","snapshot_observed_at":"2026-08-16T11:54:06.041205Z","title":"Decoding-time language model alignment with multiple objectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.041205Z"},"links":{"cited_paper":"/paper/2406.18853","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:75f8def6261c78f34faa98134a150c0469a56519d15b982785bdabe8eb035025","observation_id":"a18016d9-115a-49ed-92ec-fac52e27ea8b","resolution":{"observed_at":"2026-08-16T11:54:06.041205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19312","last_updated":"2026-04-16T21:43:49Z","snapshot_observed_at":"2026-08-10T09:12:30.058938Z","submitted_at":"2025-02-26T17:08:46Z","title":"FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19312","snapshot_observed_at":"2026-08-16T11:54:06.045704Z","title":"Fspo: Few-shot preference optimization of synthetic preference data in llms elicits effective personalization to real users","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.045704Z"},"links":{"cited_paper":"/paper/2502.19312","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:babf8b655ac39e0a9bf53b5f6b9bfb5c50145d5bcc6d327bd1712ec4699a6d8e","observation_id":"b2ee5bd2-3e0a-464b-bf55-98169421c3b9","resolution":{"observed_at":"2026-08-16T11:54:06.045704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-08-14T17:53:51.886327Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05070","snapshot_observed_at":"2026-08-16T11:54:06.049818Z","title":"A roadmap to pluralistic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.049818Z"},"links":{"cited_paper":"/paper/2402.05070","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:92d84748cede1b295f283648ee4e6d588ee051fd48d206cfa8f7f1b32050fb09","observation_id":"9deda73d-a1ad-4809-9739-c4f638485e67","resolution":{"observed_at":"2026-08-16T11:54:06.049818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.053836Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.053836Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:10f10c5e4bd088908550d4e7ff6e0671fc33db722c8f361ddb58ce04cf3fb02c","observation_id":"55330826-cfa2-4c37-b4a1-f01887116134","resolution":{"observed_at":"2026-08-16T11:54:06.053836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:54:06.059040Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.059040Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:fef081472fdd73c55f5d28b9269f763047e876e5c225f35d2f038c8c29268d8f","observation_id":"9df6f9b7-735c-41da-9f6d-223ad81b8861","resolution":{"observed_at":"2026-08-16T11:54:06.059040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-19T09:52:21.794296Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-16T11:54:06.063698Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.063698Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:c2bddfd043ec606a8c6d3b76acdd40471684bb8d8e2e91ede4f06e056a02c1c4","observation_id":"87d360a2-0c1b-4601-8fdd-e8a7c92f2419","resolution":{"observed_at":"2026-08-16T11:54:06.063698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09269","last_updated":"2024-11-07T16:43:01Z","snapshot_observed_at":"2026-08-16T14:18:36.432085Z","submitted_at":"2024-02-14T15:55:30Z","title":"Personalized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09269","snapshot_observed_at":"2026-08-16T11:54:06.067641Z","title":"Personalized large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.067641Z"},"links":{"cited_paper":"/paper/2402.09269","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:36151244139fd9bb5a0dd1973ed1186c540175adf45423237dd9aa16322ebd25","observation_id":"2ec9883b-f703-4de7-8738-d1dab63c1356","resolution":{"observed_at":"2026-08-16T11:54:06.067641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:54:06.071717Z","title":"Fine-grained human feedback gives better rewards for language model training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.071717Z"},"links":{"citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:5652c0f1856f1c963acabe292083533c2f19154a43477a7af303da6f4b126625","observation_id":"e8333ac3-9a37-4bda-9dea-f977ff39a6ff","resolution":{"observed_at":"2026-08-16T11:54:06.071717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11523","last_updated":"2024-10-14T20:02:11Z","snapshot_observed_at":"2026-08-19T22:53:12.148521Z","submitted_at":"2023-10-17T18:41:57Z","title":"Group Preference Optimization: Few-Shot Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11523","snapshot_observed_at":"2026-08-16T11:54:06.075505Z","title":"Group preference optimization: Few-shot alignment of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.075505Z"},"links":{"cited_paper":"/paper/2310.11523","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:c6bea4f89e8ce1f6dd00d805aca8fca47b5e57834d7402b50ac135e64cf40cd7","observation_id":"a3ef44be-5a1f-4b90-b46c-6a02a921506b","resolution":{"observed_at":"2026-08-16T11:54:06.075505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03708","last_updated":"2024-08-17T13:39:13Z","snapshot_observed_at":"2026-08-19T09:52:24.920763Z","submitted_at":"2023-10-05T17:35:26Z","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03708","snapshot_observed_at":"2026-08-16T11:54:06.079666Z","title":"Beyond one-preference-for-all: Multi-objective direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.079666Z"},"links":{"cited_paper":"/paper/2310.03708","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:f29742ee2b893bad003c66556ad359f6d0167ede13c6810ea50e9a4a295effb5","observation_id":"3e0f880f-7f83-43c9-b6a0-7e51c2b5d8d5","resolution":{"observed_at":"2026-08-16T11:54:06.079666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11779","last_updated":"2025-03-08T14:01:37Z","snapshot_observed_at":"2026-08-17T05:49:41.689822Z","submitted_at":"2024-08-21T17:09:00Z","title":"Personality Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11779","snapshot_observed_at":"2026-08-16T11:54:06.084084Z","title":"Personality alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.084084Z"},"links":{"cited_paper":"/paper/2408.11779","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:1e1b7f83673a5644d0a9a998ab7c5e58606519944a698d296ed906059ed1b849","observation_id":"2a92bf4e-2c36-4cea-83a9-2b220a95fcdc","resolution":{"observed_at":"2026-08-16T11:54:06.084084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-21T16:54:14.450108Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T11:54:06.088353Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.088353Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:73eb93b804b65fc8c111fd17e10b23cfc541c1b270a7cddd83236e22578d42b7","observation_id":"4ac1b61b-3fde-401d-966f-f361b7bee87b","resolution":{"observed_at":"2026-08-16T11:54:06.088353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20296","last_updated":"2025-02-24T16:00:16Z","snapshot_observed_at":"2026-08-16T13:14:07.978719Z","submitted_at":"2024-09-30T13:55:42Z","title":"PersonalLLM: Tailoring LLMs to Individual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20296","snapshot_observed_at":"2026-08-16T11:54:06.092545Z","title":"Personalllm: Tailoring llms to individual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:06.092545Z"},"links":{"cited_paper":"/paper/2409.20296","citing_paper":"/paper/2504.14439"},"observation_digest":"sha256:1e5cea3c2f46c4ce6a7aef6d4d0c31ebf2b54f9b64b385cac8feef3a05011c53","observation_id":"9e095462-30f9-4058-aa0f-73cd05767539","resolution":{"observed_at":"2026-08-16T11:54:06.092545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.14439","last_updated":"2025-04-20T01:16:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T16:27:59.029195Z","submitted_at":"2025-04-20T01:16:24Z","title":"LoRe: Personalizing LLMs via Low-Rank Reward Modeling"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 7 inbound Pith citation observations for arXiv:2504.14439."}