{"as_of":"2026-08-13T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da1f3d1d6748970f8849d4693c3eea208e81dec70abf64562ae57ab36b22247c","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:45:12.452310Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00911/citation-record","integrity":"/paper/2501.00911/integrity","json":"/paper/2501.00911/citation-record.json","paper":"/paper/2501.00911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.429409Z","title":null,"venue":null,"work_id":"c4b8e96a-f08b-4ca9-8913-31c8ea52e93e","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.164501Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:18d101a5d099719b98d9eea7d2e0de9d30c0894cfb769704eb0eb4684067684e","observation_id":"ec3479bc-16d1-42ff-a4ff-c498c8b31ee3","resolution":{"observed_at":"2026-08-10T22:45:13.434617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.412300Z","title":"https://claude.ai/ Claude","venue":null,"work_id":"991c944d-226f-45d4-bc7d-8ebab4f4f11b","year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.170691Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:fd9afdfeb5b22745443ed7058dc9d07733c12dbbf6556cb14e217c2d72cd8958","observation_id":"4b844550-bd51-45df-8c11-613835eda028","resolution":{"observed_at":"2026-08-10T22:45:13.417746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07875","last_updated":"2017-12-06T20:01:54Z","snapshot_observed_at":"2026-07-06T05:27:45.080675Z","submitted_at":"2017-01-26T21:10:29Z","title":"Wasserstein GAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07875","snapshot_observed_at":"2026-08-10T22:45:12.176006Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.176006Z"},"links":{"cited_paper":"/paper/1701.07875","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:d5192cab71a015f0620e09fc70e5e9e4940687064240f78c1ddc2c4506636a67","observation_id":"4a3f310d-bb93-4017-8622-985e59cf9656","resolution":{"observed_at":"2026-08-10T22:45:12.176006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.181779Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.181779Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:8ec327b82bd8ecc225593f46c516b214e40f16da128374be6f9bb05400e90c75","observation_id":"22a944a4-4d6f-4d3f-8f29-81a8644bf16b","resolution":{"observed_at":"2026-08-10T22:45:12.181779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T22:45:12.187680Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.187680Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:06e4be10e1cb9fefaaa06bd5a7334224f200a4b692854974769b3bb007052c91","observation_id":"4a0b8ffb-f07f-4273-8905-0b6072b4c0e3","resolution":{"observed_at":"2026-08-10T22:45:12.187680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.385183Z","title":null,"venue":null,"work_id":"5692aab2-f2b0-452f-b01f-0f4bb9206a5c","year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.198606Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:e53fd9297bc742bc41f3a0bdede935dd14f17830b40eb8415c3af562b86169f3","observation_id":"9fd5e676-b502-475b-96b3-aa5f68fe30fd","resolution":{"observed_at":"2026-08-10T22:45:13.390203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.364494Z","title":null,"venue":null,"work_id":"de02c767-3123-413a-9de3-7549752d6a9e","year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.204272Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:4ab5c76797adf4b36b7a0ee55d0cb2691d9dd5ac05358eaaedd5163fde5e3c6a","observation_id":"b63d2dc6-dc34-44d1-b8f6-9dc536e35640","resolution":{"observed_at":"2026-08-10T22:45:13.370858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:45:12.209009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.209009Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:9355817ab782018906893a441442c76fee3482ebf222f2e29e117dcdcedc2197","observation_id":"f22e4843-f4f6-4675-a54d-bd31bcd59cb4","resolution":{"observed_at":"2026-08-10T22:45:12.209009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.215495Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.215495Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:83f67cc5f24a7566444d619ebd813c3f84aedaa7cae638614cf9a98dc8bd25de","observation_id":"51e8f850-9bfc-4a31-b938-e890656a2175","resolution":{"observed_at":"2026-08-10T22:45:12.215495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.334176Z","title":null,"venue":null,"work_id":"d67f207b-af74-457e-b915-93be47407da9","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.220549Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:d2d7934010dfcb60ff1f55300f521887b619b9b01a7fa560461dfa4530126205","observation_id":"3beec7c8-733f-454b-8434-ebf1fdfb028b","resolution":{"observed_at":"2026-08-10T22:45:13.339535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.315706Z","title":"Ustinova, Hana Ajakan, Pascal Germain, H","venue":null,"work_id":"9e49fda9-18cd-4a10-b4d7-a15c82be5237","year":2015},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.225250Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:4d1814e94a607a88c23ac027f8933cdb1a97e6ace5d197ab744049bc86a97806","observation_id":"80268a2a-c2ba-4c37-bdda-e06be7ef805e","resolution":{"observed_at":"2026-08-10T22:45:13.321934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T22:45:12.230638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.230638Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:c434cdbb1743b358563c2175cca982e890852858d126f8e1dea48b1c8f94fe11","observation_id":"0eff83a4-e1f8-4ef7-ba63-5a00b1299d15","resolution":{"observed_at":"2026-08-10T22:45:12.230638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T22:45:12.235972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.235972Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:d4d9f053a23f2238f2d3619d0114640f49225c0f1dc47c57d4933d96e5acc321","observation_id":"2d8c36a4-6021-4a39-bfe8-28126657e856","resolution":{"observed_at":"2026-08-10T22:45:12.235972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00028","last_updated":"2017-12-25T23:03:49Z","snapshot_observed_at":"2026-08-10T12:15:09.941778Z","submitted_at":"2017-03-31T19:25:00Z","title":"Improved Training of Wasserstein GANs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00028","snapshot_observed_at":"2026-08-10T22:45:12.241129Z","title":"Courville","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.241129Z"},"links":{"cited_paper":"/paper/1704.00028","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:418b22bcbc5f92fed71480f4aa18c175892bc778690d396174fa19fbb7b37d40","observation_id":"7d03db23-832b-4021-977d-f7bf771db709","resolution":{"observed_at":"2026-08-10T22:45:12.241129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-13T04:24:21.093265Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-10T22:45:12.246781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.246781Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:30352f95a0dae2844b5750d4e93e231a0429c5b3330f6c6df0db35c0aedea1e5","observation_id":"525eec75-07ad-4631-9a9f-da21d0e2f561","resolution":{"observed_at":"2026-08-10T22:45:12.246781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06751","last_updated":"2024-06-05T14:10:11Z","snapshot_observed_at":"2026-08-13T04:43:45.089058Z","submitted_at":"2024-01-12T18:36:29Z","title":"The Unreasonable Effectiveness of Easy Training Data for Hard Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06751","snapshot_observed_at":"2026-08-10T22:45:12.252155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.252155Z"},"links":{"cited_paper":"/paper/2401.06751","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:94957d2f3147acffda0634c0bb6db8d6b4328949a456e536a276eb964a903172","observation_id":"9715775d-83cb-40a2-8121-0d37b211048c","resolution":{"observed_at":"2026-08-10T22:45:12.252155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.297810Z","title":null,"venue":null,"work_id":"019ce858-1e03-4b09-8424-1c671371d937","year":2016},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.257783Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:eda2d4be8ee40b45a6270a59f58fc842cd2dc66a0ee0cda4bd810017aae08b35","observation_id":"0482d9d0-e854-4409-83b1-de60c72f6608","resolution":{"observed_at":"2026-08-10T22:45:13.302982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:45:12.262601Z","title":"Edward Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.262601Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:4ef1fb594d66917878f1fb0fe1032ec4937cecd84a98860bc7aa1985a55e2d08","observation_id":"1b571a44-facb-4844-b079-229b3f4fc963","resolution":{"observed_at":"2026-08-10T22:45:12.262601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.280253Z","title":null,"venue":null,"work_id":"59503321-dd1f-4927-b8ee-dda1689e2b2e","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.267497Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:4a1b1f84708eb5654efc6c018a4532581916838007aedfbdd91ec117aabe80d4","observation_id":"1c2111e6-485b-465c-b7c6-982e37b8167e","resolution":{"observed_at":"2026-08-10T22:45:13.285434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.261728Z","title":null,"venue":null,"work_id":"6e7b3337-c654-4b44-a541-1184e59954b3","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.272533Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:027b0ede4842a94e458a5ad548630041e5d6f5d9d6927ff89b974bdf7a4fee08","observation_id":"f719bc80-b061-4a16-9be3-dd5ca1ac8290","resolution":{"observed_at":"2026-08-10T22:45:13.268035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07078","last_updated":"2021-04-14T19:05:01Z","snapshot_observed_at":"2026-08-11T14:30:50.779704Z","submitted_at":"2021-04-14T19:05:01Z","title":"UDALM: Unsupervised Domain Adaptation through Language Modeling","version":1},"cited_work":{"arxiv_id":"2104.07078","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.07078","snapshot_observed_at":"2026-08-10T22:45:12.891444Z","title":"UDALM: Unsupervised Domain Adaptation through Language Modeling","venue":"cs.CL","work_id":"a9127fcd-1c48-4750-9515-3dd0c8b5fc1a","year":2021},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.277915Z"},"links":{"cited_paper":"/paper/2104.07078","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:7eda1860ff6cf5e639688903dccc0ed5cd4e9c34ef362d2e589307688821361f","observation_id":"5aa80a67-2fb3-40b9-af20-44ae63ebf13b","resolution":{"observed_at":"2026-08-10T22:45:12.897397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04412","last_updated":"2025-03-04T00:04:24Z","snapshot_observed_at":"2026-08-12T23:48:27.481175Z","submitted_at":"2024-06-06T18:01:02Z","title":"Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04412","snapshot_observed_at":"2026-08-10T22:45:12.283131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.283131Z"},"links":{"cited_paper":"/paper/2406.04412","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:01625776eee47723bd43e1326b90b4c39b3294fb89f5e09a854bac5801441d75","observation_id":"f121deb6-27f1-4e45-a3cb-39abe0b41336","resolution":{"observed_at":"2026-08-10T22:45:12.283131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.241354Z","title":null,"venue":null,"work_id":"64c05f9e-218a-4ebd-b8a3-3b2ef4a4ad42","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.288497Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:9b3ac23054a160cc7f04339a9534b1401c81690d4e2b0da614ff73d580079905","observation_id":"399c1371-c5ea-41d9-900a-eb1a7ec50e34","resolution":{"observed_at":"2026-08-10T22:45:13.247219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-07-29T18:39:02.141391Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-10T22:45:12.293458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.293458Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:c76b60fcff9c3bf8ae82f2f706fba585ec285c3810755474a2b90325b1bf0928","observation_id":"cac133d6-8dd6-4c6a-8397-d1f010ce696d","resolution":{"observed_at":"2026-08-10T22:45:12.293458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-10T22:45:12.299196Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.299196Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:1f4e7df219bda411d03cd0f526bd27ef3f251ee340e4e926631b45d7937e5d1f","observation_id":"f67971a3-3e53-47bb-bb5f-339ef22d38be","resolution":{"observed_at":"2026-08-10T22:45:12.299196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-10T22:45:12.304282Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.304282Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ebe38d94e749a08f5a855c08e2d4d29672d70bcc77515b64d2b265e2ea937b55","observation_id":"2855cfac-44af-460d-9951-9d95e4373c8c","resolution":{"observed_at":"2026-08-10T22:45:12.304282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.223954Z","title":null,"venue":null,"work_id":"9fe0d89b-0367-48a7-a713-a8b02648c000","year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.309736Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ba58ce6402a0cab62bb587f9b3822f37e374e91f0886eccfe89a9275d3e044d3","observation_id":"ad49babe-b993-4957-9fee-352854386105","resolution":{"observed_at":"2026-08-10T22:45:13.228994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16235","last_updated":"2024-11-08T02:17:22Z","snapshot_observed_at":"2026-08-12T23:36:34.584691Z","submitted_at":"2024-06-23T22:53:47Z","title":"Preference Tuning For Toxicity Mitigation Generalizes Across Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16235","snapshot_observed_at":"2026-08-10T22:45:12.315612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.315612Z"},"links":{"cited_paper":"/paper/2406.16235","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:94d44e78f57e1d8707a7e1fc39a8a464e1c223ec7dbe2f1e749099824457c044","observation_id":"adb34e46-df8e-40f3-9fda-79761d91fc62","resolution":{"observed_at":"2026-08-10T22:45:12.315612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T22:45:12.322212Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.322212Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:29940630f80c792ab04d3b6d9e8e5f57ee5ed792318413bb4611c4b8a26d6f1d","observation_id":"73d1d84f-8ece-4bb0-8598-380f9625dd49","resolution":{"observed_at":"2026-08-10T22:45:12.322212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-10T22:45:12.326988Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.326988Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:550d4a6b891f8870cb86ba9b56accaaaf5476743919571cfd7774a84df298629","observation_id":"df829618-1316-49a3-ba2b-111a0c5aa761","resolution":{"observed_at":"2026-08-10T22:45:12.326988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.194295Z","title":"https://chatgpt.com/ Chatgpt","venue":null,"work_id":"90b73521-9828-4a0a-a1e7-519a09a062f0","year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.332430Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:b0aacf28e0c06d2c1e382321fa5ff80fac666a05a9c1073c995ce4761f7ab05d","observation_id":"c9293c1f-65b5-46e0-81f3-3e1e4d1441dd","resolution":{"observed_at":"2026-08-10T22:45:13.211159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T22:45:12.338619Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.338619Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:0ad6cd84f568353b58cc0f50c2304d7f274effa6d254170d6de4e68ea9187ce9","observation_id":"aad28e62-e728-4eea-bb76-3be7c1245df8","resolution":{"observed_at":"2026-08-10T22:45:12.338619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-10T22:45:12.344286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.344286Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:02f3a3fce8b5ec8c5c5104fd26c757ef6ec1326158e5c564578b3a480d13e946","observation_id":"8eb05ed5-6849-4bc4-ad4b-7687b0f1e684","resolution":{"observed_at":"2026-08-10T22:45:12.344286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T22:45:12.349688Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.349688Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ca4632a2a59c48a6a82a29f5dffb9d8d6d82320d1be9316eef408399aa3d6cf6","observation_id":"b2c82572-4120-4f94-971a-a25ff1d87f10","resolution":{"observed_at":"2026-08-10T22:45:12.349688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00888","last_updated":"2025-04-18T19:45:34Z","snapshot_observed_at":"2026-08-12T23:52:02.583305Z","submitted_at":"2024-06-02T23:13:56Z","title":"Aligning Language Models with Demonstrated Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00888","snapshot_observed_at":"2026-08-10T22:45:12.355146Z","title":"Bernstein, and Diyi Yang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.355146Z"},"links":{"cited_paper":"/paper/2406.00888","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:e3b03ec44c589d8a9dc8619d11b7d8e065fc8271905304a259a78862cc164780","observation_id":"c68407d2-bd69-4615-b5b9-025746aa746f","resolution":{"observed_at":"2026-08-10T22:45:12.355146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01217","last_updated":"2018-03-09T07:20:13Z","snapshot_observed_at":"2026-07-06T05:49:45.626127Z","submitted_at":"2017-07-05T05:34:13Z","title":"Wasserstein Distance Guided Representation Learning for Domain Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01217","snapshot_observed_at":"2026-08-10T22:45:12.361165Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.361165Z"},"links":{"cited_paper":"/paper/1707.01217","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:b8a0f47d308548510b5daa685406bd69e443c0e25025722b60e8f7d942d4a6c0","observation_id":"bb8d7799-1e80-43f4-8d2a-29b83943b9e6","resolution":{"observed_at":"2026-08-10T22:45:12.361165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09472","last_updated":"2024-12-10T08:54:09Z","snapshot_observed_at":"2026-08-13T00:54:12.634757Z","submitted_at":"2024-03-14T15:12:38Z","title":"Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09472","snapshot_observed_at":"2026-08-10T22:45:12.367288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.367288Z"},"links":{"cited_paper":"/paper/2403.09472","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:1038b08d6b953f2f8e66b174a4c3acafecf1e86fea8914e3eb9b8754254e13f9","observation_id":"9d92ae9d-cbe4-41d3-96c7-d9cd1c25a657","resolution":{"observed_at":"2026-08-10T22:45:12.367288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05940","last_updated":"2023-06-24T07:43:35Z","snapshot_observed_at":"2026-08-12T12:07:05.952921Z","submitted_at":"2023-05-10T07:24:36Z","title":"Multilingual LLMs are Better Cross-lingual In-context Learners with Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05940","snapshot_observed_at":"2026-08-10T22:45:12.372847Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.372847Z"},"links":{"cited_paper":"/paper/2305.05940","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:82ae139ad825b76df5f4e120f0141db031b7880675b95857afbeafc3b0f0367c","observation_id":"2de6c780-9bdd-4dee-835c-7e2d8618b558","resolution":{"observed_at":"2026-08-10T22:45:12.372847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06601","last_updated":"2023-03-18T20:44:45Z","snapshot_observed_at":"2026-08-09T01:21:57.508175Z","submitted_at":"2022-04-13T18:41:41Z","title":"Causal Confusion and Reward Misidentification in Preference-Based Reward Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06601","snapshot_observed_at":"2026-08-10T22:45:12.378181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.378181Z"},"links":{"cited_paper":"/paper/2204.06601","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:e57134f811fa6290e4c4d0cfd48e3c752abd366b17d5859bd952dfaa6b26d19c","observation_id":"ef303f7c-fb2a-4fb1-8fde-c11ed3a7cf1d","resolution":{"observed_at":"2026-08-10T22:45:12.378181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.175335Z","title":"Chernova, and Dhruv Batra","venue":null,"work_id":"f4739a96-1319-4fc0-a282-68d54051ab2f","year":2020},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.383414Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:58a7fa1ae42c7282b674e9263bf851175ef1c6df18f96b79840ebc34610fc159","observation_id":"15eaf064-48e0-4a6e-8d5e-c6c2f796e857","resolution":{"observed_at":"2026-08-10T22:45:13.181683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3474","last_updated":"2014-12-10T21:20:54Z","snapshot_observed_at":"2026-07-06T04:03:12.627088Z","submitted_at":"2014-12-10T21:20:54Z","title":"Deep Domain Confusion: Maximizing for Domain Invariance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3474","snapshot_observed_at":"2026-08-10T22:45:12.388655Z","title":"Zhang, Kate Saenko, and Trevor Darrell","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.388655Z"},"links":{"cited_paper":"/paper/1412.3474","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:8ef20231c5307420687d698c460d9e18f955588bc92ed5b24ac23b695f26744d","observation_id":"d9e7e8de-fa6f-4e8d-a26d-4cccde6dc901","resolution":{"observed_at":"2026-08-10T22:45:12.388655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.393710Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.393710Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:a06dac61cd3610a0e1066aa2669a59dcf8ff8db9007c9c6d303b32c3b2fe3a7d","observation_id":"9e561a12-24a5-4b02-b30d-94e811486f54","resolution":{"observed_at":"2026-08-10T22:45:12.393710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.155392Z","title":null,"venue":null,"work_id":"cd4aad57-a7a3-405f-9cdb-5e1a50d255f2","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.398638Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:50e2f0b5c8ddb448e0f86770b951e0b750d8becf2d28afd3a41d200647eeb79c","observation_id":"6adc45c0-0464-4e51-a507-fb1f30304374","resolution":{"observed_at":"2026-08-10T22:45:13.161418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.135832Z","title":null,"venue":null,"work_id":"9f18020c-7d9c-4b54-b721-ea9a24b15889","year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.404542Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:f2a4eb29af0d4f830f8ee8e7b43284467a892d93fe01d953d0f3d5d9fe3319f8","observation_id":"a05d9238-5b9f-42d9-b0e6-ff3ebf2d2d76","resolution":{"observed_at":"2026-08-10T22:45:13.141030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12318","last_updated":"2024-10-14T17:58:05Z","snapshot_observed_at":"2026-08-13T00:27:15.190839Z","submitted_at":"2024-04-18T16:52:36Z","title":"Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment","version":2},"cited_work":{"arxiv_id":"2404.12318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12318","snapshot_observed_at":"2026-08-10T22:45:12.585236Z","title":"Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment","venue":"cs.CL","work_id":"104e3b2f-59d2-44cd-840b-6132babfb1d9","year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.409531Z"},"links":{"cited_paper":"/paper/2404.12318","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:8f20b97432af5c15540457cca8ece74bb9a0ab0d99eac94c642affe02c1b7e40","observation_id":"1340b498-31a0-45e7-b283-1ec86018401b","resolution":{"observed_at":"2026-08-10T22:45:12.593278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09705","last_updated":"2023-07-19T01:22:40Z","snapshot_observed_at":"2026-08-13T10:52:57.236409Z","submitted_at":"2023-07-19T01:22:40Z","title":"CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09705","snapshot_observed_at":"2026-08-10T22:45:12.414979Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.414979Z"},"links":{"cited_paper":"/paper/2307.09705","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:2cc3a5ebe97325474c4d45271d6639d9f09c83de362030aaa4e9e427e84659c2","observation_id":"97b509e2-18b3-48b6-9e74-8dfa8fc741ee","resolution":{"observed_at":"2026-08-10T22:45:12.414979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-08-12T23:42:28.794744Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-10T22:45:12.420151Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.420151Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:cb684e7d478b987e63b0c2fa90e83868325e3bb64bb6b009a7c28bcdc3d4d5c9","observation_id":"99232992-40d2-465d-94e1-27471d260e93","resolution":{"observed_at":"2026-08-10T22:45:12.420151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-12T22:56:24.326978Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-10T22:45:12.425370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.425370Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:6e97413aaeb547717776d3e4d26357087f345b8539b07fd74a17959b2b42ea3e","observation_id":"e724335a-a9ae-42b5-9421-b8240cf682a8","resolution":{"observed_at":"2026-08-10T22:45:12.425370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-10T22:45:12.431407Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.431407Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:77e33d9524242ff4680abc830fdd24a2fef9cffd031682c3961412b7f8fcaf69","observation_id":"0496f569-b2bf-4586-9b6e-075691c6365c","resolution":{"observed_at":"2026-08-10T22:45:12.431407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:13.118834Z","title":null,"venue":null,"work_id":"f8bc1c4f-64a9-4907-97ee-799de720a592","year":2017},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.436817Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:31f98050148ac6ab6528fba6575c194f069c04b8f67eb4a8c03fe723e9cd97fe","observation_id":"4a406a80-2238-4f13-bd0a-8ba6f59e3246","resolution":{"observed_at":"2026-08-10T22:45:13.123721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-10T22:45:12.441631Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.441631Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:a7ac54cc32f972a221d3f84083c4b9d6afbf40b6a53b036f1ef5f36a0fcba6c1","observation_id":"f39061c4-0a81-46a2-bb04-17b0c58d1b40","resolution":{"observed_at":"2026-08-10T22:45:12.441631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.446752Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.446752Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:103d7e9f8ad80c741234b3892d64a7d5c251deedeec60e8e896b85db6193557e","observation_id":"b527aeef-d4b6-463d-9df6-3949ecd8a411","resolution":{"observed_at":"2026-08-10T22:45:12.446752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:45:12.452310Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.452310Z"},"links":{"citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:575983c93f5cf5b2815d77b7c4558d8d50488a0ff4531a358fe73451fbde9c27","observation_id":"1adb606a-3623-4c4a-a5c1-dfb6f422aee9","resolution":{"observed_at":"2026-08-10T22:45:12.452310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2501.00911."}