{"as_of":"2026-08-19T09:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68c80fc023297f638fee7a73f241e14fae98de09eace5b9496b3f2c10b601005","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:24:12.662588Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T21:23:27.413513Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":"2402.01878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yu Meng, Mengzhou Xia, and Danqi Chen","venue":null,"work_id":"bfc560e2-a5b5-4872-9de6-480e87ef1dea","year":2024},"citing_paper":{"arxiv_id":"2408.15339","last_updated":"2026-05-07T20:32:48Z","snapshot_observed_at":"2026-08-13T05:00:40.483897Z","submitted_at":"2024-08-27T18:04:07Z","title":"UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T21:22:36.970101Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2408.15339"},"observation_digest":"sha256:14f5ed62959ec807f47c955f3c89bb446569a9f4a921d98d696c3445b8a9769d","observation_id":"2ebd1d91-ecbf-45fb-bfd3-e5688bb9c815","resolution":{"observed_at":"2026-05-23T21:23:27.417555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-12T17:15:47.880969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-17T01:00:48.700288Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.880969Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:0a248c6b7ee810abec6f8e24feff6886ecf8aea8e96210bbedfe6dad6065589c","observation_id":"0bb642c8-3734-47cb-8b39-7bd02e952bdb","resolution":{"observed_at":"2026-08-12T17:15:47.880969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-12T05:13:41.491585Z","title":"Lipo: Listwise preference optimization through learning-to-rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00631","last_updated":"2025-08-29T17:58:46Z","snapshot_observed_at":"2026-08-18T19:54:37.058880Z","submitted_at":"2024-12-01T01:01:09Z","title":"ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T05:13:41.491585Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2412.00631"},"observation_digest":"sha256:26bc948a7070976ea1797b5d5b74603ba911b2408c58d4c162f6ab49801599c4","observation_id":"ecebbdea-9c34-4716-8e01-db7c56e17d37","resolution":{"observed_at":"2026-08-12T05:13:41.491585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-10T14:46:51.815631Z","title":"arXiv preprint arXiv:2402.01878","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15007","last_updated":"2025-01-25T00:59:12Z","snapshot_observed_at":"2026-08-13T23:55:56.094752Z","submitted_at":"2025-01-25T00:59:12Z","title":"Controllable Protein Sequence Generation with LLM Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:51.815631Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2501.15007"},"observation_digest":"sha256:64a319713f952f8f044b516ed0d3d452f3a6a8e677ed85eba2711acbe73b32b7","observation_id":"52f1e475-40f3-437a-a27d-c611f82978de","resolution":{"observed_at":"2026-08-10T14:46:51.815631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":"2402.01878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yu Meng, Mengzhou Xia, and Danqi Chen","venue":null,"work_id":"bfc560e2-a5b5-4872-9de6-480e87ef1dea","year":2024},"citing_paper":{"arxiv_id":"2502.01237","last_updated":"2026-05-08T19:36:24Z","snapshot_observed_at":"2026-08-15T11:40:36.888485Z","submitted_at":"2025-02-03T10:54:14Z","title":"The Differences Between Direct Alignment Algorithms are a Blur","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T03:50:03.720389Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2502.01237"},"observation_digest":"sha256:24ee79637963cbbd6f92a005825a5e38fddb8b1f7aa3f5986d74a6a0a4a026c2","observation_id":"17aeefa1-009b-4909-aa4d-091165f021e5","resolution":{"observed_at":"2026-05-23T03:52:29.529197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-09T04:08:51.724809Z","title":"Lipo: Listwise preference optimization through learning- to-rank","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03699","last_updated":"2025-07-23T21:26:26Z","snapshot_observed_at":"2026-08-17T02:42:06.612301Z","submitted_at":"2025-02-06T01:22:06Z","title":"LLM Alignment as Retriever Optimization: An Information Retrieval Perspective","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T04:08:51.724809Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2502.03699"},"observation_digest":"sha256:90526aea8f6a94650708102c13242e8fac39c4128f88591b2a17585269b174db","observation_id":"8b1e524f-e854-4e74-b820-d5a26e47e936","resolution":{"observed_at":"2026-08-09T04:08:51.724809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-09T06:01:13.306315Z","title":"Lipo: Listwise preference optimization through learning-to-rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-18T19:00:49.919850Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T06:01:13.306315Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2502.04371"},"observation_digest":"sha256:c9cc5f84d89bb53f9ed83e265230c4a13f67e628665eb7d6dde6aae8edfe63e2","observation_id":"f00dd238-8ddf-480e-a080-9759f83a6233","resolution":{"observed_at":"2026-08-09T06:01:13.306315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-16T11:24:12.662588Z","title":"Lipo: Listwise preference optimization through learning-to- rank,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-08-17T21:55:02.668814Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:12.662588Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2504.15585"},"observation_digest":"sha256:954c75d5911b9cf2f8a77079d908da040750125af951b744effe670201c2d4d1","observation_id":"f7881d25-80d0-457c-a75b-53286b7bad60","resolution":{"observed_at":"2026-08-16T11:24:12.662588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T15:15:18.276005Z","title":"Lipo: Listwise preference optimization through learning-to-rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T20:58:02.100576Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.276005Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:1b9c6fea1ff0d17a742cbada832a5df6e9cfa3d3fe1365e8d136696a2103b35f","observation_id":"ac0a7142-37ff-468f-868a-eb0e608aa41a","resolution":{"observed_at":"2026-08-07T15:15:18.276005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T14:57:28.962243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-17T10:55:42.169363Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.962243Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:7b822fcd6aaf8c5f520326d32d1e58be85bf8469ef96655a99d83424b7786fdc","observation_id":"6852c46f-e6fb-4d63-972d-aac640c962ee","resolution":{"observed_at":"2026-08-07T14:57:28.962243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T13:45:55.816724Z","title":"Liu, and Xuanhui Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21061","last_updated":"2025-05-27T11:47:28Z","snapshot_observed_at":"2026-08-16T21:04:06.257131Z","submitted_at":"2025-05-27T11:47:28Z","title":"LPOI: Listwise Preference Optimization for Vision Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:55.816724Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2505.21061"},"observation_digest":"sha256:30ec6af57cf44ea07f0ce97b44b52c283a6e4a51e59058e224c591b64b06893d","observation_id":"8d7eba4a-3ff9-4c93-ad87-bddebd038360","resolution":{"observed_at":"2026-08-07T13:45:55.816724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T12:00:48.923951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00805","last_updated":"2025-06-01T03:11:00Z","snapshot_observed_at":"2026-08-15T21:25:53.313888Z","submitted_at":"2025-06-01T03:11:00Z","title":"HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:00:48.923951Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2506.00805"},"observation_digest":"sha256:37e750c037845e12c5e5a288ea31a7dc5a9b53dea66c92f5cb246c081c6e7f70","observation_id":"c104ef4b-df02-4545-b873-a02691f147ea","resolution":{"observed_at":"2026-08-07T12:00:48.923951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T10:28:48.212275Z","title":"Lipo: Listwise preference optimization through learning-to-rank.arXiv preprint arXiv:2402.01878, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-16T15:12:01.896424Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.212275Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:7281abc8e2a1043c73b43d1e1bbfbafb0c1e744d1cf6ab4fd72d398ff55449a2","observation_id":"98d5ad29-7c6a-41bb-900b-d36ab5f2d551","resolution":{"observed_at":"2026-08-07T10:28:48.212275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-15T19:38:50.674235Z","title":"Lipo: Listwise preference optimiza- tion through learning-to-rank.arXiv preprint arXiv:2402.01878,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15421","last_updated":"2025-06-18T12:46:39Z","snapshot_observed_at":"2026-08-16T17:35:22.013765Z","submitted_at":"2025-06-18T12:46:39Z","title":"Reward Models in Deep Reinforcement Learning: A Survey","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:38:50.674235Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2506.15421"},"observation_digest":"sha256:e2ea2788e463e2ba58bd94fd49496d1dbd1e2fe75e1ed5a8ad949a605c98c89c","observation_id":"2fe16626-45d2-4e09-a520-a493d26b41fe","resolution":{"observed_at":"2026-08-15T19:38:50.674235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-05T16:13:08.310472Z","title":"Liu, and Xuanhui Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18884","last_updated":"2025-08-26T09:59:44Z","snapshot_observed_at":"2026-08-16T12:52:44.628963Z","submitted_at":"2025-08-26T09:59:44Z","title":"HAEPO: History-Aggregated Exploratory Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T16:13:08.310472Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2508.18884"},"observation_digest":"sha256:ea0c48d094fd028529a171ae165067d4fa87dfb66cc771e7ab157ae2c9e06bb8","observation_id":"9bfe8b37-794b-4f8e-8281-d7588622099f","resolution":{"observed_at":"2026-08-05T16:13:08.310472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":"2402.01878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yu Meng, Mengzhou Xia, and Danqi Chen","venue":null,"work_id":"bfc560e2-a5b5-4872-9de6-480e87ef1dea","year":2024},"citing_paper":{"arxiv_id":"2605.04653","last_updated":"2026-05-06T08:59:16Z","snapshot_observed_at":"2026-08-11T14:33:33.046249Z","submitted_at":"2026-05-06T08:59:16Z","title":"Threshold-Guided Optimization for Visual Generative Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T17:14:36.632493Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2605.04653"},"observation_digest":"sha256:2e8091fbebb846dcf93f79d96ddd53424c7cf9fb12a083278ca688acd551ed45","observation_id":"582509b3-ae83-4d8b-ad9a-5603ce94dccc","resolution":{"observed_at":"2026-05-11T17:46:07.941014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":"2402.01878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yu Meng, Mengzhou Xia, and Danqi Chen","venue":null,"work_id":"bfc560e2-a5b5-4872-9de6-480e87ef1dea","year":2024},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:c7663055fb5ef899f58e15c0956e62c850472e1c925138a5a21b6649ae0c8261","observation_id":"1838de3e-0a41-455a-b996-f0c3cb00713a","resolution":{"observed_at":"2026-05-11T04:46:00.020414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2402.01878 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-15T02:40:10.141978Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":231,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:de6524e43c9d842faf8109fd76979448b5df26ec002e79c96f2386b6e009af6b","observation_id":"c99c18e0-2630-4461-99d9-37a51bcdf627","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2402.01878 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:4fb53ec6b995515a1619db2278db38fe79beb91e8fd0968d0ff3f6c5f7aaa988","observation_id":"b3380034-14bd-4832-8393-397a7c40bb0f","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-02T08:40:41.165786Z","title":"arXiv preprint arXiv:2402.01878 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.165786Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:2af5026c4737d1ed99147907a238c771002a21e8438f9bf42f6f3104e3cb5c0e","observation_id":"910aa229-e412-462f-b930-696349ee7d06","resolution":{"observed_at":"2026-08-02T08:40:41.165786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.01878/citation-record","integrity":"/paper/2402.01878/integrity","json":"/paper/2402.01878/citation-record.json","paper":"/paper/2402.01878"},"outbound":[],"paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T00:23:07.879811Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2402.01878."}