{"as_of":"2026-08-12T09:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9819254d901e0061f82ff5eeebfd1fdf3819ce36b1a4aa54056ea131a9fdb4c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:48:04.530071Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T14:02:11.084514Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T14:02:39.792894Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"cited_work":{"arxiv_id":"2506.07165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07165","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amopo: Adaptive multi-objective preference optimization without reward models and reference models","venue":null,"work_id":"d97ff518-99bf-4057-b187-396de23f4677","year":2025},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2506.07165","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:2be72be6bd97669a1bd7665e869d8ca7dc1c1c1ca906aea52c9a686a9f46fd5b","observation_id":"7f8dbf7d-2cd1-4c5d-8052-3748243927f9","resolution":{"observed_at":"2026-05-18T14:02:39.796329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07165/citation-record","integrity":"/paper/2506.07165/integrity","json":"/paper/2506.07165/citation-record.json","paper":"/paper/2506.07165"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.380172Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.380172Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:bdd94c79eb02fb5cb5e29597b2829f60f83c1744be22c5a3ec7484370b1ccdad","observation_id":"509ef113-699f-40ce-8791-51ccddbc9a56","resolution":{"observed_at":"2026-08-07T05:48:04.380172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.384800Z","title":"- (2) Acknowledges both but slight deviations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.384800Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:8a537e8bb1ca71367b6261dd563780327902364244da85951628e566afc454f3","observation_id":"6a775cc4-d1d3-4e49-8a9b-cb25c3ccb4a9","resolution":{"observed_at":"2026-08-07T05:48:04.384800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17956","last_updated":"2025-05-25T15:23:18Z","snapshot_observed_at":"2026-08-10T17:12:58.924991Z","submitted_at":"2024-05-28T08:35:48Z","title":"Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier","version":4},"cited_work":{"arxiv_id":"2405.17956","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17956","snapshot_observed_at":"2026-08-07T05:48:04.751353Z","title":"Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier","venue":"cs.AI","work_id":"b2f4cb96-1929-4137-9169-73cd1d5e649c","year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.333706Z"},"links":{"cited_paper":"/paper/2405.17956","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:3a3880524f2507386d50a880e44e90ba72f0a8b11a55fd52c25590a912ca0235","observation_id":"1b1a3283-9453-4c75-b10b-7acce1c8d99c","resolution":{"observed_at":"2026-08-07T05:48:04.758497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.201885Z","title":"Based the instruction following rule and given my answer to an instruction, your role is to provide specific and constructive score for me","venue":null,"work_id":"09533352-a64b-4c65-a486-99550a241950","year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.394469Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:748172ecf62f0d416341e87cdf676f4a3ac93d86161cefac70aa981a0a6f75b8","observation_id":"71380829-229d-44c8-9d61-8c582f171bdb","resolution":{"observed_at":"2026-08-07T05:48:05.206741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.905328Z","title":null,"venue":null,"work_id":"056ffc95-22ec-469a-9063-5dc96393879f","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.489631Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:245aac7132f9de63bc6b1f87ac7e64868bc5d14614bbeec0086a81ace2baea7c","observation_id":"86162f79-067f-4f88-b0c0-d2f4e8348557","resolution":{"observed_at":"2026-08-07T05:48:04.909769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05469","last_updated":"2024-12-06T23:51:47Z","snapshot_observed_at":"2026-08-11T20:39:26.169024Z","submitted_at":"2024-12-06T23:51:47Z","title":"Multi-Objective Alignment of Large Language Models Through Hypervolume Maximization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05469","snapshot_observed_at":"2026-08-07T05:48:04.350188Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.350188Z"},"links":{"cited_paper":"/paper/2412.05469","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:54bc3246dac228e9fb0bd9a76031e34f20afdf727a084c3a7d14dcef05ed6dc9","observation_id":"4aab7911-1989-4d87-9051-75447098113c","resolution":{"observed_at":"2026-08-07T05:48:04.350188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.799907Z","title":null,"venue":null,"work_id":"8b185360-8249-43d3-a280-058d3b1f5f95","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.520670Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:c9ebe552fc5f8bd7e7c1d94ce6ad2055ce88b1b33bb79b5b8ca6e9c87c15b388","observation_id":"fbff26fe-c0c9-46e4-bedc-349cecf533f1","resolution":{"observed_at":"2026-08-07T05:48:04.804950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.254185Z","title":null,"venue":null,"work_id":"ff02fdeb-5a12-4f34-a96d-62cb5ab379b3","year":2023},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.360084Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:deb209e60a567fb3b0c293b9ec4568b7623d6e80b31ccf292c636c53906bfb10","observation_id":"603471d7-87ff-4375-9720-010016c55d82","resolution":{"observed_at":"2026-08-07T05:48:05.258845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.769273Z","title":"Al ter na tively, you can use a nav iga tion app like Google Maps or Waze to get the most ac cu rate and up -to -date di rec tions","venue":null,"work_id":"3a81254c-83ff-4ddc-b343-8c8b5efcffc1","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.530071Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:c513b2c4c4cfeeda97d4903f1398fa3d3cd913b3d64c0e93b63f0a5ac06fd8be","observation_id":"5fbb7736-bb7b-42f0-86de-4dcedd084167","resolution":{"observed_at":"2026-08-07T05:48:04.774067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-11T15:39:32.425305Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T05:48:04.370319Z","title":"Zheng Yuan, Hongyi Yuan, Chuanqi Tan, Wei Wang, Songfang Huang, and Fei Huang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.370319Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:eef7fbf2c0ee56d1e3f1017955a957fa09dfb139e76e7b386009c9a0ca270dc9","observation_id":"a6c9871d-7ba5-4d27-ba1d-24fa4ab96c53","resolution":{"observed_at":"2026-08-07T05:48:04.370319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.375331Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.375331Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:dc55f63cf929b5e40e5d2a683d2ddb692f9d9852ece8c1cd3388436ad56dfed9","observation_id":"1f6ca1b9-2929-4fd4-a204-d7da3e8cf2d7","resolution":{"observed_at":"2026-08-07T05:48:04.375331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.389549Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.389549Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:c540e77dfe620046860f58c553a1f1dfe1a23ccb304f289f00a2aacf88ab438b","observation_id":"d9e92826-9fb6-46ae-8ebc-a6341bdc5fa9","resolution":{"observed_at":"2026-08-07T05:48:04.389549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.187193Z","title":"The response completely missed the essence of what the user wanted","venue":null,"work_id":"e98ef131-9ba4-4398-a198-ec3029444a6b","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.399006Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:a5da6644342d650fa6e8b1b24313374272f2a3f6af0e77879c2beec891fc0612","observation_id":"ed371d59-8070-42de-9b40-2ce71ec1f177","resolution":{"observed_at":"2026-08-07T05:48:05.192139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.173578Z","title":null,"venue":null,"work_id":"b97f6bec-3343-4faa-945b-0a84c3692428","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.403467Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:6380ea0d59465cbbd94f9daba0d6b92f01dec26efe1cf17ce14e96b6b1287522","observation_id":"0cd52a9f-1b84-4ad1-a6bd-9cbb8fd30d50","resolution":{"observed_at":"2026-08-07T05:48:05.177921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.159291Z","title":"The response did not fully satisfy what the user was looking for","venue":null,"work_id":"4f9c71e3-7778-4074-a783-30cbec12855e","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.408360Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:3282530f114a2c16b6460c218b0f9bf9a4268166843bd892e2431e687d22efbe","observation_id":"cd53e2c5-9267-4541-9df4-ee050e8602fb","resolution":{"observed_at":"2026-08-07T05:48:05.163942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.145631Z","title":null,"venue":null,"work_id":"04882c83-3e6c-44cd-b4e0-53d2526a9fac","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.413250Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:d2f6015a181bb87935531281efd4ed1d5da65612b244d305da9af6ee88436c51","observation_id":"aa9b1903-cb42-4c0a-814c-254e76fae5c4","resolution":{"observed_at":"2026-08-07T05:48:05.150165Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.131749Z","title":"Based the helpfulness rule and given my answer to an instruction, your role is to provide specific and constructive score for me","venue":null,"work_id":"31bf72f3-b36b-4862-88f0-65fb0d21d769","year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.417719Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:9cdb6d94d784e237e19eccf06d3a3679f05fd41276a83e27f0dc482482503afe","observation_id":"cbc3e889-c355-4e81-9ff2-9165a1ad4ad2","resolution":{"observed_at":"2026-08-07T05:48:05.136403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.117955Z","title":"All information provided is wrong, false or hallucinated","venue":null,"work_id":"3be583c8-8a83-4086-94f9-1e6adb961889","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.422395Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:e6b3529ce5c320ae3efb124a00078b0b6a07859a233b16d1c342a71e71336d54","observation_id":"32325681-7ec1-4dd6-9bdf-f0ea1f3c9990","resolution":{"observed_at":"2026-08-07T05:48:05.122505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.104009Z","title":"The response may contain multiple instances of hallucinations, false information, misleading information, or irrelevant information","venue":null,"work_id":"e8aaa5c2-c085-4074-b519-1c589192e34f","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.426726Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:cb1e5dd4dc4a4988c9a4d1bc77ea278216e9935c4b1076b2a403dcfa079ad544","observation_id":"52821ed3-340a-4e97-a005-215c70773b3c","resolution":{"observed_at":"2026-08-07T05:48:05.108613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.089578Z","title":"The response may miss some details, contain misleading information, or minor hallucinations, but is more or less aligned with what the prompt asks for","venue":null,"work_id":"7dfe333d-b80c-4ed3-ae3e-7a6066bd94e6","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.431058Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:bbe43bdff3480ed7c43981e193a5621b1bdc0d1c82017d39a24c3228d97b5a18","observation_id":"58aa1c99-ebb1-497d-9d3e-ebc5d1b74f66","resolution":{"observed_at":"2026-08-07T05:48:05.094666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.075005Z","title":"It contains no misleading information or hallucinations","venue":null,"work_id":"fc528add-f887-4e63-bfe4-b31498f1afe0","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.435493Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:27619935fb23dfc8bd51784e25e0e412dd04f4c03582f2e5f1dee3d87c9cb527","observation_id":"7fd95f00-d9a4-45b7-9049-a5a45085108f","resolution":{"observed_at":"2026-08-07T05:48:05.079708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.059480Z","title":"preference","venue":null,"work_id":"fc7f9563-0a24-43c0-a28d-cb7431b608fe","year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.439958Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:45ddcb1a415d9c8cc3f2c85a588bc0becd1bc4f0e5c5d264473c9936839ff375","observation_id":"790f3e81-e2ec-499a-aab5-3cfcc4769e69","resolution":{"observed_at":"2026-08-07T05:48:05.065370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.044701Z","title":null,"venue":null,"work_id":"4c369c54-c361-4931-aa27-37f5e70fa7c7","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.445478Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:ec35fc34f59d0862034a30d583c8c2c6b1eda97b656d9c399ad60631a1111ea7","observation_id":"0011564e-56b0-4aab-abea-a22f639a26d9","resolution":{"observed_at":"2026-08-07T05:48:05.049744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.030582Z","title":null,"venue":null,"work_id":"7eea6638-c0d7-4fdb-82a4-adcf45607e07","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.449913Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:86f3f4a92a97f18d6548601f69373cccf5e32de091a8d705e70577e6a835adca","observation_id":"3f29bfbe-07b8-4c9f-a11d-1b34ce1daa2a","resolution":{"observed_at":"2026-08-07T05:48:05.035054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.016053Z","title":null,"venue":null,"work_id":"069ab928-5209-4ea9-98e5-60202a414124","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.454405Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:a852f79ed02c470de2e374de8a7fe90c998967f432623fa0e5f42cda9da5bbf0","observation_id":"dce37129-54b0-45fb-8324-9574dd80a10a","resolution":{"observed_at":"2026-08-07T05:48:05.020579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.001683Z","title":null,"venue":null,"work_id":"d315cb33-c209-45c0-a735-84f0eb093d60","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.458745Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:f3def553a0b4ad12dbdd949c103b65d5351efe31eec8270a57ae825da44bc5e7","observation_id":"4af259a0-678c-44b6-8a77-ec21b6b0bcc1","resolution":{"observed_at":"2026-08-07T05:48:05.006108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.987748Z","title":null,"venue":null,"work_id":"ebe2ca51-911f-4734-846e-ef78b34e13c5","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.463266Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:b5dbe24baa3e971a6cc95a9ac9b3d019cf9dd0f7bb49817c34fd72c75db8ffe2","observation_id":"48b3e66d-2b68-455e-8ba5-0529e032da40","resolution":{"observed_at":"2026-08-07T05:48:04.992129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.973451Z","title":"“markdown“‘markdown. This is an example of a code block in Markdown. You can see that it is formatted to look like it’s not part of the regular text flow","venue":null,"work_id":"6f010835-a6dc-4127-9205-ab1d80a5ad6f","year":1999},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.467611Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:272dd55c5ebdd4916028a1f329b9132b0fb295def1c6e76649de843ba5c61d35","observation_id":"40e32249-f472-4723-8fff-fd3817ceeb14","resolution":{"observed_at":"2026-08-07T05:48:04.978143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.959509Z","title":null,"venue":null,"work_id":"70b7dc6d-d8f2-43a4-bcf8-1d2deb9d660a","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.472349Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:b1d858eac4d7264f261b4fb962b153325b593e08bb22e45a3d8cd8343e0c09c8","observation_id":"0d84453a-c1c0-4a46-8b93-550b18215763","resolution":{"observed_at":"2026-08-07T05:48:04.963674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.946062Z","title":null,"venue":null,"work_id":"99c3d135-1145-40e6-87ec-bc7af32f04a9","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.476696Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:aa56b6315137d8eec5d5397c7344e5db7df16ff12e8041dd5254f7d39aca66ab","observation_id":"76909b5b-1482-4ff9-8e44-9f0fcfd9bfd7","resolution":{"observed_at":"2026-08-07T05:48:04.950425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.932515Z","title":null,"venue":null,"work_id":"585f5f92-2d70-45f0-a5c8-0659a9e9d6db","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.480870Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:b565af5ea580abd63ad77d93ad9255b203657e0f3d1e47f3d7fa03f779e19087","observation_id":"ebadc2cd-9ee1-40cb-b856-13ae76e0a176","resolution":{"observed_at":"2026-08-07T05:48:04.937069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.919033Z","title":null,"venue":null,"work_id":"ae0eb9b5-dc38-4145-901a-7d0cf08a9bcd","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.485127Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:727f3788239db057abc0eb206963c346272956b8736bbfd0a84fad7b8f54135c","observation_id":"b862183f-ab10-4734-86ba-1069bdc073a7","resolution":{"observed_at":"2026-08-07T05:48:04.923359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.890835Z","title":null,"venue":null,"work_id":"4043a41c-9cce-4ae6-b3cc-3195608c5788","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.494306Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:cf0dcc9440409d68a96dda0bcca66b5d099259fd16a1d13fb126fd0a0b8445ee","observation_id":"41fc8d2a-bdb7-4ad1-a839-ac4003e13cda","resolution":{"observed_at":"2026-08-07T05:48:04.895292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.876827Z","title":null,"venue":null,"work_id":"76f36024-086f-4603-9472-6f70b5dc8260","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.498733Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:26252808a4adb3e9379ab806e789ab6b0aba94d2c0a310a70bd297e9f23cd81d","observation_id":"46f191fa-7d8e-42ec-a79a-c6b79afd8bfe","resolution":{"observed_at":"2026-08-07T05:48:04.881178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.861447Z","title":null,"venue":null,"work_id":"0dbfcb83-f559-4fe4-b51e-e42c4fc0d7fe","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.502975Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:16952108705a5f85e0fa4917ea683464abd2c110fd00312fc20f6044c3b8b2ad","observation_id":"8905fa09-1251-4ee1-ad62-a8170e0d10ff","resolution":{"observed_at":"2026-08-07T05:48:04.866254Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.845216Z","title":null,"venue":null,"work_id":"911e9a74-7b33-4391-9795-03853c470022","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.507704Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:ff0f7d708565537e3e5ec580980ec3f9a01d7050fccb029377e757d8ac6115da","observation_id":"0666dcdc-6eb4-4a53-9d2a-e916603e2a7f","resolution":{"observed_at":"2026-08-07T05:48:04.850567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.829415Z","title":null,"venue":null,"work_id":"3655d84e-d0ae-4807-b226-55ccd780f8c4","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.511997Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:bc854eebed7d2bc8e6c06a026cd7a5ecdeaa01f99b635c43d7e878a3ec9444c9","observation_id":"4b3002d7-2969-41ed-bdf5-5b0cce6667fe","resolution":{"observed_at":"2026-08-07T05:48:04.834072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.814698Z","title":null,"venue":null,"work_id":"e2a725d1-c71f-422c-a898-a80907787d75","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.516378Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:d03853147affa2bd11fea5152e83678808332345009c43e486e66445df02dec8","observation_id":"76cc2232-739b-4d7b-8197-e6c39dab316a","resolution":{"observed_at":"2026-08-07T05:48:04.819470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:04.784651Z","title":null,"venue":null,"work_id":"c62f5577-058e-479d-9c07-45c141a036e5","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.525653Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:b932c30a8c37629b8204042e468d1752a408cd35572f95336b0c220570468a7a","observation_id":"d97ec2f6-8e34-480a-9c64-b69b5dd026f1","resolution":{"observed_at":"2026-08-07T05:48:04.788887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-07T05:48:04.364900Z","title":"Hao Sun, Yunyi Shen, and Jean-Francois Ton","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":1027,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.364900Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:2872f84efb78436b5899429183263c606bc2e605e7e6afbaa454d1fe7d4ce665","observation_id":"a13a5ca8-7485-485b-9904-bfad94f57cc4","resolution":{"observed_at":"2026-08-07T05:48:04.364900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:48:04.339130Z","title":"Pattern Anal","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.339130Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:9b261c9ebbe6093917c57d88a6d41e95bfa4a7ec91a25247267385dc84b66712","observation_id":"10c276b0-1f1d-4f37-ba7b-f54921c2139b","resolution":{"observed_at":"2026-08-07T05:48:04.339130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.268810Z","title":"Ryan Park, Rafael Rafailov, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"6880ad06-51af-4ed1-94c8-f2506df5d98d","year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.355394Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:9385d2ab3ec9117e874f1a583669ee263079a38f0059dd67f0e5d12491f46d91","observation_id":"46dcb65d-320c-4102-bf03-cf7d6de321d5","resolution":{"observed_at":"2026-08-07T05:48:05.273911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11564","last_updated":"2023-10-17T20:22:13Z","snapshot_observed_at":"2026-08-12T06:32:49.060067Z","submitted_at":"2023-10-17T20:22:13Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11564","snapshot_observed_at":"2026-08-07T05:48:04.345187Z","title":"Seongyun Lee, Sue Hyun Park, Seungone Kim, and Minjoon Seo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.345187Z"},"links":{"cited_paper":"/paper/2310.11564","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:09fbc0e343b36aae773c7ebaba040ab4df9e3504bc3ff8455f0b70d745435f6b","observation_id":"b655c1f6-dca9-4a28-bdb0-b8ca25589367","resolution":{"observed_at":"2026-08-07T05:48:04.345187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.298815Z","title":"Mohammad Gheshlaghi Azar, Zhaohan Daniel Guo, Bi- lal Piot, Rémi Munos, Mark Rowland, Michal Valko, and Daniele Calandriello","venue":null,"work_id":"40dbf32b-3775-4931-a78a-c35e3490c29c","year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.324206Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:e8eebc32ca3eb52d8bd881c674b46e0ec5ffdf4d9c35ebb9cde5c7776100e888","observation_id":"46af202c-d500-4828-b593-0f2cd9e422e8","resolution":{"observed_at":"2026-08-07T05:48:05.303657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:48:05.284053Z","title":"Anirudhan Badrinath, Prabhat Agarwal, and Jiajing Xu","venue":null,"work_id":"90f016cf-00c3-4ada-b159-2bf204bb1bcb","year":null},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":4455,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.329332Z"},"links":{"citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:12123d7323d509888dcf1f23ea585b000a2392bbebf2d98380d5b9f1581264c1","observation_id":"91b171db-f386-42d6-88ab-6aa8242fb34e","resolution":{"observed_at":"2026-08-07T05:48:05.288823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:26:00.472551Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":29,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2506.07165."}