{"as_of":"2026-08-14T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:baa6782565b1b2aa8139546409607104f328afc2ae5ed4e9672097bea0c427e4","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:02:42.537188Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:39:02.891861Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:46:04.570352Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"cited_work":{"arxiv_id":"2507.01368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activation reward models for few-shot model alignment","venue":null,"work_id":"db3a0e4f-5eeb-4e1a-abe6-6e203f8fc277","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-11T03:30:51.869417Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":222,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2507.01368","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:12cd515806791c500bf65a1be23af8c1aad772cc54870d57c95defa011443d86","observation_id":"df15135a-6ad7-4bf5-9d50-2dfb086d01af","resolution":{"observed_at":"2026-05-10T14:00:28.437494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"cited_work":{"arxiv_id":"2507.01368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activation reward models for few-shot model alignment","venue":null,"work_id":"db3a0e4f-5eeb-4e1a-abe6-6e203f8fc277","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2507.01368","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:7636216e67a73d196db2baa1c550aca878438b59e758491536c0b386a01c4910","observation_id":"c697a69a-b83f-45aa-8222-9158dc93e9e7","resolution":{"observed_at":"2026-05-11T13:46:04.573192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01368","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Activation reward models for few-shot model alignment.arXiv preprint arXiv:2507.01368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-14T09:02:37.471652Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2507.01368","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:0109d8916c6023b961eda19427ffcd067e4c45aaa27a7a55c95461c6bd8fb819","observation_id":"e10fc225-4be8-474f-9947-e9332a7ffc41","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01368/citation-record","integrity":"/paper/2507.01368/integrity","json":"/paper/2507.01368/citation-record.json","paper":"/paper/2507.01368"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.321263Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.321263Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b6f5e5bed7752bce6cf49d3fd1e0020cabc60c4801c854d359d1c7e7986ee6f0","observation_id":"a309e831-ad2e-4be8-83ef-60ed9188627e","resolution":{"observed_at":"2026-08-06T21:02:42.321263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:02:42.325145Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.325145Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:4801331aafda4bbd61a53f445ea5efe18909c1d955a033a90da580032c53edc2","observation_id":"3392bfb3-0a1b-4fa3-b2c9-0efd1d22b87f","resolution":{"observed_at":"2026-08-06T21:02:42.325145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:02:42.331317Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, Benjamin Mann, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.331317Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:1f57c003b639e147f3a521902951762ab2b837b72ca0bd1eef721d6a29883557","observation_id":"e39bdd43-c782-4440-85ce-e37b73592ede","resolution":{"observed_at":"2026-08-06T21:02:42.331317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T21:02:42.337121Z","title":"Constitutional AI: Harmlessness from AI feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.337121Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:87842925cb8a0af5a9bd6f2b49c74c1ea807c50474d9f6c2efb069fbe4eda6a6","observation_id":"ca3027ac-b74b-4c0e-b83f-5a15eface521","resolution":{"observed_at":"2026-08-06T21:02:42.337121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.339704Z","title":"Capturing individual human preferences with reward features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.339704Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:f41d918c56e40ce8ca48de7c23489b34f24dac52a9c9d4c07f0d81c4b9166b8c","observation_id":"71de3fff-e5fe-4a2f-8a1e-0c330a8d5a01","resolution":{"observed_at":"2026-08-06T21:02:42.339704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.375602Z","title":"Network dissection: Quantify- ing interpretability of deep visual representations","venue":null,"work_id":"e1078009-bf79-44ee-9544-514ebece4a20","year":2017},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.342712Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:c562b0ed8e67a8ae3f7639de568692fe2388f64e68d61c14962b997be6cc6cee","observation_id":"0e72bd98-4df8-4b46-ab47-2f018686a0d8","resolution":{"observed_at":"2026-08-06T21:02:43.378656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.367387Z","title":"Understanding the role of individual units in a deep neural network","venue":null,"work_id":"37087c58-81d8-44ff-96bc-ad7c884dbede","year":2020},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.345424Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:237520e70b58dc1b12c9e0199d5f39c172a017d6e4dbbd61d28fc9ed48d63734","observation_id":"61cdfbcf-9caf-459b-81d2-7543ce242d59","resolution":{"observed_at":"2026-08-06T21:02:43.370334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T21:02:42.348325Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.348325Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:3208cf8659bd1e9e5504091896edc6d31b91f6dfd930a84364432d316e8a2011","observation_id":"53587fdb-b7bb-48fe-99fd-bbac1ee0e9d9","resolution":{"observed_at":"2026-08-06T21:02:42.348325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.358527Z","title":"RRHF-V: Ranking responses to mitigate hallucinations in multimodal large language models with human feedback","venue":null,"work_id":"1ace6ae4-9278-4e94-b36c-b03e0b1516a0","year":null},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.351096Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b7d3507c04c0488c2b43ab498f547ca679c93bbe1101568c3062f1738fcb3419","observation_id":"73ebb749-b745-4825-9bd6-38f9b129794b","resolution":{"observed_at":"2026-08-06T21:02:43.361377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.341835Z","title":"Denison, John Schulman, Arushi Somani, Peter Hase, Misha Wagner, Fabien Roger, Vlad Mikulik, Sam Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":"aa08d0ab-93dc-4feb-a6e0-95f7e2342eee","year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.357004Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b19c9ead2b9eef0024dcffe091089e73926d77ab0b635f4acf2dd2f82723c848","observation_id":"a7db32e6-3734-400e-ae30-4dc63aedd773","resolution":{"observed_at":"2026-08-06T21:02:43.344698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.333831Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"1d0cf42d-d069-4e16-ab55-827baeeba97c","year":2017},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.359782Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:428a9b57e7129d44bed0b76dc1c8d811e165d10eaa13857288fa9a5055198202","observation_id":"bcab6f08-6cb1-457a-992b-c32bdb4344f6","resolution":{"observed_at":"2026-08-06T21:02:43.336451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-06T21:02:42.362383Z","title":"Bowman, Ethan Perez, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.362383Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:caf2f08851ff44af06230870b820bad793d28e333b7b82a13dd0928fbf13c432","observation_id":"333f3104-8309-43ff-a71a-fa32a444418a","resolution":{"observed_at":"2026-08-06T21:02:42.362383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-13T05:02:09.847989Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T21:02:42.365297Z","title":"Pfohl, Deepak Ramachandran, Peter Shaw, and Jonathan Berant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.365297Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:583ff142dc53ba6ca0d0187fc684af3c602d1a4665218e738d870825771c357c","observation_id":"0b8325f5-f3fe-49db-925f-63231a3714a4","resolution":{"observed_at":"2026-08-06T21:02:42.365297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10951","last_updated":"2023-03-23T21:31:18Z","snapshot_observed_at":"2026-08-06T09:36:46.171618Z","submitted_at":"2021-03-19T17:59:08Z","title":"Paint by Word","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10951","snapshot_observed_at":"2026-08-06T21:02:42.368595Z","title":"Paint by word","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.368595Z"},"links":{"cited_paper":"/paper/2103.10951","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:011f6871a909c4ae15c76a8d60aeaa219d8e95c89f42beb7e8a2306b05a678f9","observation_id":"dd0d2183-911c-4a10-84e4-5364a54d0916","resolution":{"observed_at":"2026-08-06T21:02:42.368595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T21:02:42.371326Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.371326Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:33abc78ba1f0b2ae207a4ad8b2e6d97fa4d170a1c1aef28e5a3ba73039ae9587","observation_id":"565ec317-f552-4704-8525-3be5fb04fa51","resolution":{"observed_at":"2026-08-06T21:02:42.371326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15522","last_updated":"2025-05-20T06:23:39Z","snapshot_observed_at":"2026-08-13T15:22:15.402126Z","submitted_at":"2024-10-20T22:09:44Z","title":"M-RewardBench: Evaluating Reward Models in Multilingual Settings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15522","snapshot_observed_at":"2026-08-06T21:02:42.374334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.374334Z"},"links":{"cited_paper":"/paper/2410.15522","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:bd13edd44c8c78f4c19da5ec1dd267df7aed93525b75e28505cd276016be76cd","observation_id":"7b27f7cc-25e1-485c-9580-29ab4868c157","resolution":{"observed_at":"2026-08-06T21:02:42.374334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.324713Z","title":"In-context learning creates task vectors","venue":null,"work_id":"f2a12327-843a-492f-999b-b94cc37fd5c2","year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.377311Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:f40bfb0a2b3db6e3b1e32c05f2dd306edaf1fff579227e636b450e3713e711ec","observation_id":"701e53e9-6d25-4896-916e-b67d26311382","resolution":{"observed_at":"2026-08-06T21:02:43.327878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-13T05:42:05.425097Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-06T21:02:42.379822Z","title":"In-context learning creates task vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.379822Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:9b5a931fd8feb81348265377ab871bc3c7215e7c52e624374a0116c2d03db8b5","observation_id":"2b2b4cff-a11b-420f-ad15-f45d39767669","resolution":{"observed_at":"2026-08-06T21:02:42.379822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00740","last_updated":"2024-08-09T22:00:11Z","snapshot_observed_at":"2026-08-13T12:10:37.832608Z","submitted_at":"2023-04-03T06:24:10Z","title":"Inspecting and Editing Knowledge Representations in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00740","snapshot_observed_at":"2026-08-06T21:02:42.382687Z","title":"Li, and Jacob Andreas","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.382687Z"},"links":{"cited_paper":"/paper/2304.00740","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:8a2ee3d69ab70e99975bae0f76b63ad2a0745dc7b59407543f5fffd2426ab703","observation_id":"c8ad2182-a253-43d3-9764-a0c2b1c06f15","resolution":{"observed_at":"2026-08-06T21:02:42.382687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.315969Z","title":"Finding visual task vectors","venue":null,"work_id":"a2e5e8ac-ff4c-4d06-b98d-e47037f51970","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.385383Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:504f9b7d71aa955d4f884f656356c2c506c69aec303158e07d398ef322f8e390","observation_id":"bff11584-e388-4db1-b95c-74ee3e411e88","resolution":{"observed_at":"2026-08-06T21:02:43.318883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14610","last_updated":"2023-06-26T11:35:22Z","snapshot_observed_at":"2026-08-13T11:09:24.121685Z","submitted_at":"2023-06-26T11:35:22Z","title":"SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14610","snapshot_observed_at":"2026-08-06T21:02:42.387975Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.387975Z"},"links":{"cited_paper":"/paper/2306.14610","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:40e6eefda8b2190899468240a1d271788ec62a4800bb9c8567419602366cdbcb","observation_id":"26c76699-badc-4c7e-861a-fd81a78130c5","resolution":{"observed_at":"2026-08-06T21:02:42.387975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.306510Z","title":"Multimodal task vectors enable many-shot multimodal in-context learning","venue":null,"work_id":"c5cf5b22-2973-4388-935c-439e5ebea304","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.390963Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:804e63c222f456f10877e5248c32c2d5d6cfd839a6a69f48eec3fb8d10ce92cb","observation_id":"d8fe77af-5b37-4b9d-ac1d-607631c37add","resolution":{"observed_at":"2026-08-06T21:02:43.309709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.297521Z","title":"Multimodal task vectors enable many-shot multimodal in-context learning","venue":null,"work_id":"9f764eae-481a-48c0-b0ae-0940dc519d98","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.393812Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:663a613f2b8b91b9c3b23026a4916a8809e762f708b1193b966d18cf5936fcb3","observation_id":"739cb215-0073-4d93-91f7-2a70c9221e3d","resolution":{"observed_at":"2026-08-06T21:02:43.300705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13746","last_updated":"2024-12-18T11:28:05Z","snapshot_observed_at":"2026-08-11T18:07:40.121451Z","submitted_at":"2024-12-18T11:28:05Z","title":"RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13746","snapshot_observed_at":"2026-08-06T21:02:42.396463Z","title":"Rag-rewardbench: Benchmarking reward models in retrieval augmented generation for preference alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.396463Z"},"links":{"cited_paper":"/paper/2412.13746","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:d7c735186e175ff95c2c826d9352d4d9dba8b71f5a593e4fa10be41ca0b7d83c","observation_id":"ca3a6e68-0545-4c7a-aadb-9fb082c0ee22","resolution":{"observed_at":"2026-08-06T21:02:42.396463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13998","last_updated":"2024-12-18T16:14:59Z","snapshot_observed_at":"2026-08-12T06:32:44.431104Z","submitted_at":"2024-12-18T16:14:59Z","title":"Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13998","snapshot_observed_at":"2026-08-06T21:02:42.399277Z","title":"Few-shot steerable alignment: Adapting rewards and llm policies with neural processes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.399277Z"},"links":{"cited_paper":"/paper/2412.13998","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:7221bc9a1796349ab47d4823b86cecf3fb9cbd74db1fb414221a405b39ec0ae3","observation_id":"8acdb000-0686-4932-9d12-8726a2b6d43c","resolution":{"observed_at":"2026-08-06T21:02:42.399277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T21:02:42.402165Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.402165Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:46a8c5bd7ea4876736d0e1f83981039150ca6dc7b8b1d7cbf8a6a667be556846","observation_id":"5529c393-9ff4-4b69-8aad-fd628fabf51a","resolution":{"observed_at":"2026-08-06T21:02:42.402165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.287977Z","title":"RLAIF vs","venue":null,"work_id":"7fda7a42-4d04-45c4-a240-06da35dde6f1","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.405063Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:44198ade63e9fe2553a1009d260e7e47b3f3b258669da5c3b79c46474801d170","observation_id":"1a064690-906b-4d33-b571-b637800c65ef","resolution":{"observed_at":"2026-08-06T21:02:43.291393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.278428Z","title":"RLAIF vs","venue":null,"work_id":"4d45afc7-8964-4b54-a42d-adf8d900f0dd","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.407759Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:840ba9c86d141cfc2d66bb92aeef1bd748b042d61f92d642c528fabc50f12daf","observation_id":"1bd11883-f8cd-44a9-b664-ddd46ee6c5ff","resolution":{"observed_at":"2026-08-06T21:02:43.281451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.269052Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"0fdb9646-1841-40cc-998b-42fe10777fcb","year":2021},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.410251Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:045179bce5331d0fb1b3ae90fdba5b0f3c915f1ff62c81d2f94ad6beb4b983ff","observation_id":"301eebe0-a8d2-4d91-9e22-d502c04e8352","resolution":{"observed_at":"2026-08-06T21:02:43.272260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:02:42.413245Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.413245Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b6b7699560ef4d6ef805afc656463b942304c744c62a784bd85290f54efc4766","observation_id":"d5696a21-e77d-48dd-87c1-d6158f0f5657","resolution":{"observed_at":"2026-08-06T21:02:42.413245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.416301Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.416301Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:1b361298d56dd20d7478d4891b1f36f13b9425e118d6cebcfec461b42eeb69f4","observation_id":"0ac81866-ea23-4e7a-89f0-c1a62e6a1509","resolution":{"observed_at":"2026-08-06T21:02:42.416301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.252999Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":"6b5c0409-ef9e-4ac9-b7db-67fd88e9928e","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.418758Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:754a320a2b9ea7a21bd54288aff3849fdd418f531ee6254882bf8718ff0453c4","observation_id":"0495770b-eb30-4685-bb38-1008d01ebe57","resolution":{"observed_at":"2026-08-06T21:02:43.256118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.244170Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":"de6ceaa0-a36f-4339-b297-c816b8176bfc","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.421311Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:977e6e08ee4e15091017f080a77e7c40d6549cf3e73fc3e53bc4bfe43ca8b0b4","observation_id":"82779433-6465-4df6-9e46-967589565a75","resolution":{"observed_at":"2026-08-06T21:02:43.247216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-13T01:49:12.898890Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00142","snapshot_observed_at":"2026-08-06T21:02:42.424201Z","title":"Sparse attention vectors: Generative multimodal model features are discriminative vision-language classifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.424201Z"},"links":{"cited_paper":"/paper/2412.00142","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:11a4af0fe49f3f7bd36d275e239fab21fd2f101370b27c4f7767d927fab32238","observation_id":"e87e8d74-2e2e-4461-b28c-1e519c258d34","resolution":{"observed_at":"2026-08-06T21:02:42.424201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01111","last_updated":"2024-11-02T02:22:21Z","snapshot_observed_at":"2026-08-12T22:09:21.291029Z","submitted_at":"2024-11-02T02:22:21Z","title":"Rule Based Rewards for Language Model Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01111","snapshot_observed_at":"2026-08-06T21:02:42.427164Z","title":"Kivlichan, Molly Lin, Alex Beutel, John Schulman, and Lilian Weng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.427164Z"},"links":{"cited_paper":"/paper/2411.01111","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:43bc8e016c53c51453c7d6c1de36ef280582e8019d1735f8e44d6d78735664c2","observation_id":"2295d038-75a9-4a7b-92da-5174726ff034","resolution":{"observed_at":"2026-08-06T21:02:42.427164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-06T21:02:42.429971Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.429971Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:6d6d1b2a7c8ef00444fb4b250fe8e320b480eceb53306ce0e1dcfe0f400e6cb9","observation_id":"f932738d-68f2-4a43-9acd-b74640b2bcbf","resolution":{"observed_at":"2026-08-06T21:02:42.429971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:02:42.432668Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.432668Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:63658905441e14e47540e6d46b798197af611ec32fe02119277c303dda249f82","observation_id":"9de138df-d363-4716-a9cf-d5e70f13e740","resolution":{"observed_at":"2026-08-06T21:02:42.432668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.235055Z","title":null,"venue":null,"work_id":"0bb7aacc-785c-425a-afe9-50f95e6ce175","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.435269Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:7550ec9caae83737523182d9521515b972b550cae8e95ac761a59e79af753aeb","observation_id":"2e53c4cd-a86c-401b-a243-ea10fb95f939","resolution":{"observed_at":"2026-08-06T21:02:43.238094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.225765Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"422c1908-e90c-4df2-8c8a-3bafcd91994e","year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.438395Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:4a2464c55df11a35aaabe01a7ed8d7fbcc1faf06661530fd5cb75770274920b1","observation_id":"ed740f6a-768d-440b-ae61-43cb915c2319","resolution":{"observed_at":"2026-08-06T21:02:43.229102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.217028Z","title":null,"venue":null,"work_id":"bde942f2-d223-4a51-8791-01c0d40415e9","year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.440917Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:44bea3ef1a98488bf95d3f807303c548482aa323b566fe643702b4d19180cca4","observation_id":"09a7c555-8945-4616-ac78-ffc005f697fa","resolution":{"observed_at":"2026-08-06T21:02:43.219895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-06T21:02:42.443531Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.443531Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:6644cb70aaf252f48bf796df9b25c2240a41fbd7cb01070f859ae2153d7c6b17","observation_id":"18c8f537-ed32-4557-a495-86e6bfb803a1","resolution":{"observed_at":"2026-08-06T21:02:42.443531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.446511Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.446511Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:04cf5a05068b39b39bd8adccde55ff5026900b3a18f4f2ed61f256d8681e6d49","observation_id":"6ef9ecfa-3019-442a-90d9-88d37689425d","resolution":{"observed_at":"2026-08-06T21:02:42.446511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-06T21:02:42.449385Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.449385Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:4b6afded7374cd7cbb7c9b0ab0376f2a8a394429e7345b9d2aa30d83db1f7f7d","observation_id":"bdc8313f-0b58-48f9-b918-8a89e203f6ba","resolution":{"observed_at":"2026-08-06T21:02:42.449385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.452328Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.452328Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:95d4578ba9e78a17b6c6b939fb34d9a53fa8a91d7f03385fdea77d9b4faa69ba","observation_id":"89618b88-420f-45bd-ae5d-8471c85695b0","resolution":{"observed_at":"2026-08-06T21:02:42.452328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T21:02:42.455001Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.455001Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:8a5ed39b116568e4fb0cfc0f8f29589a7764bf9a0d093eb93111c449a6ed188c","observation_id":"f0234c10-4552-46d9-a723-ca951d5ca19e","resolution":{"observed_at":"2026-08-06T21:02:42.455001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13077","last_updated":"2024-10-15T22:50:58Z","snapshot_observed_at":"2026-08-13T00:03:21.673387Z","submitted_at":"2024-05-21T03:16:35Z","title":"GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13077","snapshot_observed_at":"2026-08-06T21:02:42.457877Z","title":"GPT-4 jailbreaks itself with near-perfect success using self- explanation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.457877Z"},"links":{"cited_paper":"/paper/2405.13077","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:9595b5112a51b607ca0556477c531f45f62e4f7e4f81b32542b5bed8973b540c","observation_id":"9b59a616-ab3d-40e1-a961-41b0ddcf8921","resolution":{"observed_at":"2026-08-06T21:02:42.457877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T21:02:42.461296Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.461296Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:18db6b7905f4cdf735b6a991884d211ee72ebf21c092c507d75c1253fe0fedfd","observation_id":"08a76f31-3f9e-4e7a-923b-1454c5381435","resolution":{"observed_at":"2026-08-06T21:02:42.461296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02536","last_updated":"2024-02-21T23:23:18Z","snapshot_observed_at":"2026-08-13T12:32:04.327199Z","submitted_at":"2023-03-05T00:57:49Z","title":"Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02536","snapshot_observed_at":"2026-08-06T21:02:42.463921Z","title":"Finding alignments between interpretable causal variables and distributed neural representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.463921Z"},"links":{"cited_paper":"/paper/2303.02536","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:ffef1656a6ccf37daa1a35c4e0022eb42536fcdbdc1c938c0582400ccc7cd2e6","observation_id":"68bbd057-2773-4fa5-a82f-ded588030d21","resolution":{"observed_at":"2026-08-06T21:02:42.463921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T21:02:42.466647Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.466647Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:cf05d946d0e01b01b7ff25d4030bac4cac8424d26682353a0f077f03289f19ca","observation_id":"a6b977d1-c958-4b0e-8354-29a257170a05","resolution":{"observed_at":"2026-08-06T21:02:42.466647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19312","last_updated":"2026-04-16T21:43:49Z","snapshot_observed_at":"2026-08-10T09:12:30.058938Z","submitted_at":"2025-02-26T17:08:46Z","title":"FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19312","snapshot_observed_at":"2026-08-06T21:02:42.469412Z","title":"FSPO: Few-shot preference optimization of synthetic preference data in LLMs elicits effective personalization to real users","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.469412Z"},"links":{"cited_paper":"/paper/2502.19312","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:955e0687953630d7d7bb70a1bee0de088b968234f95b3a19f0d74fe88e6b1b88","observation_id":"416fede6-7ea0-435b-b28f-6c9561e43e39","resolution":{"observed_at":"2026-08-06T21:02:42.469412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.196094Z","title":"Alpaca: A strong, replicable instruction- following model","venue":null,"work_id":"95579ca3-382f-4ccb-8aec-65dab8b03e7e","year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.472472Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:8f1c6e041840301e9d5384f48db248cb9222bdea36e1929092d494ae6c315261","observation_id":"01895fb7-6d99-4260-ad20-7e6d22c9fcd4","resolution":{"observed_at":"2026-08-06T21:02:43.199194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.475288Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.475288Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:de33ec126f4c51b1c4263c5d86d854209ed62ed6481967c278daed89b5b478cd","observation_id":"6a231fd1-79dc-4ccd-9ef3-66cb51d24458","resolution":{"observed_at":"2026-08-06T21:02:42.475288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.180414Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, Paul Christiano, Jan Leike, and Others","venue":null,"work_id":"cf87f63b-a34f-4ee7-9a16-091fe1ccbfc6","year":2020},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.477978Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:f760f65fa842d953f1a4ff73524dd7987d9cf855607b5b9453c98e00725d5421","observation_id":"01348201-5f79-4333-a21a-8e69d5d86b58","resolution":{"observed_at":"2026-08-06T21:02:43.183491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.170333Z","title":"Extracting latent steering vectors from pretrained language models","venue":null,"work_id":"9a940132-8334-4863-897f-825ba5da44c2","year":2022},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.480561Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:f3c2c53912b844ab78e0e7d40da004537a23566f26837d6197438606f8b64299","observation_id":"7597d84e-84c7-4f0c-ae61-22ea44d0e9ff","resolution":{"observed_at":"2026-08-06T21:02:43.173972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-08-10T18:50:32.127116Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09927","snapshot_observed_at":"2026-08-06T21:02:42.483528Z","title":"Granite vision: a lightweight, open-source multimodal model for enterprise intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.483528Z"},"links":{"cited_paper":"/paper/2502.09927","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:966f137e62d64cffadf708fdacba394153020a14402a0cf8b3741008f8bfc282","observation_id":"6c308a2a-af65-4032-94a0-27c9dc16d7ee","resolution":{"observed_at":"2026-08-06T21:02:42.483528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.160921Z","title":"Li, Arnab Sen Sharma, Aaron Mueller, Byron C","venue":null,"work_id":"0afb8e28-7d9d-46b9-b325-44990429c1cb","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.486151Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b46adc9ab4f3393c713ecd3e886734eb1154a4f1a27f78e84ac478b8d3d915ba","observation_id":"d87fff3e-fc59-4c55-8b05-953b8182f488","resolution":{"observed_at":"2026-08-06T21:02:43.163979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T21:02:42.488755Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.488755Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:ae7776753471651b1ebd7de792855cb944d4b9dc8f4cc107373fa4ebe20c5974","observation_id":"5b0d810c-d934-4b46-a0ab-e1a0b4d32077","resolution":{"observed_at":"2026-08-06T21:02:42.488755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T21:02:42.491453Z","title":"Vazquez, Ulisse Mini, and Monte MacDiarmid","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.491453Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:a0a98ffc5d4324368111925fbdb08b60e1cdcb12d33b8d45b3f02a9db8c80e7d","observation_id":"d292f8cf-a3bb-4424-bba5-1c9b73ac1628","resolution":{"observed_at":"2026-08-06T21:02:42.491453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:02:42.494467Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.494467Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:af33696ed031bd971e7ee2275c918b01c84bd193159ca5b50cc08e09df681d41","observation_id":"c0166f73-c608-4948-9c7d-e922a1945039","resolution":{"observed_at":"2026-08-06T21:02:42.494467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.151735Z","title":"Large language models are not fair evaluators","venue":null,"work_id":"23989bbc-4b47-4286-9981-3372772f9213","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.497393Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:aca0e2f7b49f66a9de8a5c70760dde30403d4a1f7357f5e00ffd9843a104fd73","observation_id":"885d840c-9f1f-4e78-bc23-e9c322835eef","resolution":{"observed_at":"2026-08-06T21:02:43.154796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.141764Z","title":"Williams","venue":null,"work_id":"7aeb8cce-a7f6-4409-a0b6-fc289c2e0da6","year":2004},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.500110Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:e307e1ee7f8bec5144a424cde6acf9433fe74a46ccb6b8e700b2123228dac3ca","observation_id":"e8db6c18-6cf8-4e95-9d2c-fd2e7aa05d7e","resolution":{"observed_at":"2026-08-06T21:02:43.144570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.502647Z","title":"rewordbench: Benchmarking and improving the robustness of reward models with transformed inputs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.502647Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:7a5f60033e011f3defd02aaf6016e061f0291b453caefa6b61b4be624bd28cb2","observation_id":"5c653327-9475-4a00-8979-ce6e5ce22713","resolution":{"observed_at":"2026-08-06T21:02:42.502647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-08-07T18:03:15.507750Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-06T21:02:42.505501Z","title":"Multimodal rewardbench: Holistic evaluation of reward models for vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.505501Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:d58e039bbc3d54beffad11cd7a3d1222e8f660e39143f2dc211347a20107722c","observation_id":"e2908560-f838-4916-a340-625aab08f338","resolution":{"observed_at":"2026-08-06T21:02:42.505501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.133162Z","title":"Zettlemoyer, and Marjan Ghazvininejad","venue":null,"work_id":"f2d92939-48d3-4f15-a9e2-b47fd24f06af","year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.508936Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:ef94a88e00af53a5aef1577dd210100dd88d81f917bdd3fc5da05fd76e1e7434","observation_id":"b9ac0d03-a65d-4f0b-ad1a-586be8f418bb","resolution":{"observed_at":"2026-08-06T21:02:43.135993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.123836Z","title":"Which attention heads matter for in-context learning? In Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025","venue":null,"work_id":"7e49abc3-9356-45da-aacc-13e74b577e51","year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.511545Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:84bcc9206d508b15eb29f5c257b2190b1eae32dde9527c1e02d7b6c4c97d2fc3","observation_id":"a898471a-c5b5-4a9c-bb5c-6c89f20c46d1","resolution":{"observed_at":"2026-08-06T21:02:43.127194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17233","last_updated":"2025-04-03T08:27:46Z","snapshot_observed_at":"2026-08-12T22:17:20.573722Z","submitted_at":"2024-10-22T17:53:34Z","title":"ICPL: Few-shot In-context Preference Learning via LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17233","snapshot_observed_at":"2026-08-06T21:02:42.514668Z","title":"ICPL: Few-shot in-context preference learning via LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.514668Z"},"links":{"cited_paper":"/paper/2410.17233","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:ffd20540c4a59b07bed84aa624a9afe6303e6282780cc1eed7f1fdd469e977cd","observation_id":"fdfc61a0-60bb-41b1-8192-1c5893abc6df","resolution":{"observed_at":"2026-08-06T21:02:42.514668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.517736Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.517736Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b9d475b5a12ff74f9a8b511c6f93c7d0eef4ae6d1b3a079dc16f5fd3c8eab08c","observation_id":"4d7b7262-f799-465f-a7e2-0578d1c3d2a1","resolution":{"observed_at":"2026-08-06T21:02:42.517736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-13T20:00:16.671415Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-06T21:02:42.520388Z","title":"Rrhf: Rank responses to align language models with human feedback without tears","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.520388Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:421b74fbae07e23570e1fbd4bba3a0a65e5bea3ed363f00ba2d9c871e097148c","observation_id":"e8f5b9bb-35ec-4f6f-84c6-d5d8950363da","resolution":{"observed_at":"2026-08-06T21:02:42.520388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:42.523148Z","title":"Rag-reward: Optimizing rag with reward modeling and rlhf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.523148Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:72af9318dc9ffee2deb7b8036eafc11a66d7ae4055c66c9f19f85159fb9059b5","observation_id":"eaef4565-ec43-4aa0-8dd9-7c359a83de49","resolution":{"observed_at":"2026-08-06T21:02:42.523148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.107132Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"d66bd1b2-4fc7-4fa7-ba83-9a9dff5f7d01","year":2024},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.526351Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:cf451c1bbe630c7fbb48c42a179759b53dca353a2a489594afc8e836bc5188d2","observation_id":"206120a9-5041-4a56-a862-e9e6169bdc5a","resolution":{"observed_at":"2026-08-06T21:02:43.110641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.097551Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"7b230f59-21aa-42dc-9fe9-980a6f1cc6b1","year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.529059Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:6486a7ea913b31e1a2b7e225d6094ca4d820c4bad7cf078e7924100c349087f1","observation_id":"0ac44e47-5c44-4ac3-9f80-4bbcdfea8319","resolution":{"observed_at":"2026-08-06T21:02:43.100892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-06T21:02:42.531667Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.531667Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:8d187ab8dc927ee4de6c6dba924b05e3eb1f1d3ccb14b58357e2f2803f952531","observation_id":"7508d138-a168-4880-8c5b-b1f4a844fd42","resolution":{"observed_at":"2026-08-06T21:02:42.531667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.085995Z","title":"Interpreting deep visual representations via network dissection","venue":null,"work_id":"fd72835a-33af-4ffc-8e81-0dc70af6de20","year":2018},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.534698Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:e911102c966481ced997d2ee493dec4e707862544468cd2cfb9c06090013ca36","observation_id":"39407f16-bc69-4dcc-afc7-8c670e2c90e6","resolution":{"observed_at":"2026-08-06T21:02:43.090900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T21:02:42.537188Z","title":"Activation Reward Models","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.537188Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:91d9d82b1585530e36f263dbc854e99576a03b1387907bb98d59f2284c75b822","observation_id":"a0b6a405-a8af-46ec-8d6b-3882c7fdc397","resolution":{"observed_at":"2026-08-06T21:02:42.537188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:43.350175Z","title":null,"venue":null,"work_id":"a06ea8a3-52dc-45e7-9b08-2995df183cc8","year":null},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.354176Z"},"links":{"citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:90295eebc9949a5cdcf2790672ce2ccdc3ba57007eb9f7d65ed3b55beb67108c","observation_id":"97ed4056-3f3b-4b9c-8b63-918eb0850aa2","resolution":{"observed_at":"2026-08-06T21:02:43.352767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:26:45.734009Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2507.01368."}