{"as_of":"2026-08-18T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:168ef9a7b2ea753f91e9aa2f23d813a8eb2280bb5ad1b76d94221eee87bc2047","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:34:00.091046Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T17:35:43.819146Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:53bc6b4205cb6c43f88be8e77b6bcce1881f526a20619dd0c7d56569a0f46101","observation_id":"b8114625-c371-4b9f-ba32-9776f8bf6193","resolution":{"observed_at":"2026-05-17T16:18:01.653875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:d2fdafaed7749b1006c5d05658935d060506b447431fffb8d2cb8e6473c87a67","observation_id":"6e23e892-f64e-402d-9d1a-76d508738a51","resolution":{"observed_at":"2026-05-23T17:35:43.821753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-12T13:06:27.883420Z","title":"Offsetbias: Lever- aging debiased data for tuning evaluators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16502","last_updated":"2025-02-26T16:46:25Z","snapshot_observed_at":"2026-08-15T20:57:47.162339Z","submitted_at":"2024-11-25T15:37:27Z","title":"Interpreting Language Reward Models via Contrastive Explanations","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-12T13:06:27.883420Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2411.16502"},"observation_digest":"sha256:7590e0790add0aa90efd812a003d1fe6dba37fc82eaa3e377df25a074e07719a","observation_id":"eef2f67f-fc87-40da-a019-8cb8cd92a048","resolution":{"observed_at":"2026-08-12T13:06:27.883420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-12T11:03:01.188993Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators.arXiv preprint arXiv:2407.06551, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18688","last_updated":"2025-06-14T04:20:06Z","snapshot_observed_at":"2026-08-12T10:56:39.039288Z","submitted_at":"2024-11-27T19:00:10Z","title":"Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:03:01.188993Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2411.18688"},"observation_digest":"sha256:e064a1749bb1776f8dea7585018f47b4752d4b9474e6ebdb8c5ffa09b96d39e9","observation_id":"b809d533-f053-4a48-bf02-b40e061d3cc8","resolution":{"observed_at":"2026-08-12T11:03:01.188993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:0aa36136d01b1f287f6b1600c2daa996771b26c1454f8b56af2dbfe459b2e147","observation_id":"d10d3d48-12cd-4bb2-a8f7-0f6ab458808a","resolution":{"observed_at":"2026-05-11T23:11:13.149064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-09T11:32:47.926599Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-13T21:01:10.025945Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.926599Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:e2a199ad99cf5ff07853b0bf77f4b78bd8e84c42e6992092308721b56444f4de","observation_id":"54600f9e-9665-49c2-8dac-a1a8bb733340","resolution":{"observed_at":"2026-08-09T11:32:47.926599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-16T12:34:00.091046Z","title":"Qiu, J., Guo, D., Natalie, P., Noelle, P., Cheri, L., and Henry, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.091046Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:a7d6dbc382e9ee68086158606e3eb684944dcc002ed474477987baa02dc2df26","observation_id":"31398427-a194-46fc-9c48-0a2b2dd6c92b","resolution":{"observed_at":"2026-08-16T12:34:00.091046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-16T11:33:53.491812Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15253","last_updated":"2025-05-21T23:42:20Z","snapshot_observed_at":"2026-08-16T17:13:15.936554Z","submitted_at":"2025-04-21T17:33:23Z","title":"Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:33:53.491812Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2504.15253"},"observation_digest":"sha256:ffa3aa1fc3ba6fac7e7a6e598c865dff2fdd41326ca267171d26fad639cc8a1a","observation_id":"c8014eb0-9e0e-4c9d-b102-143e4b4e20af","resolution":{"observed_at":"2026-08-16T11:33:53.491812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-15T22:40:34.455462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06827","last_updated":"2025-05-11T03:41:13Z","snapshot_observed_at":"2026-08-15T22:29:30.367056Z","submitted_at":"2025-05-11T03:41:13Z","title":"Sandcastles in the Storm: Revisiting the (Im)possibility of Strong Watermarking","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:40:34.455462Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2505.06827"},"observation_digest":"sha256:d4eac12ed995ebb9da42330f42f19a2acd59aa83f854358f486d8dcec5c9c853","observation_id":"ee68f132-4b5e-4f95-aeee-ddce04755a16","resolution":{"observed_at":"2026-08-15T22:40:34.455462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-15T21:12:52.701060Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.701060Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:b8d55842b31fd1cf1a3f85566c5e7725e2be888d5f24341a164a93ad771e8d25","observation_id":"c0978775-496a-4fb0-932b-a78846273445","resolution":{"observed_at":"2026-08-15T21:12:52.701060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-15T20:50:10.626884Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.626884Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:c2d300f813d80f89f2650bea81ebf7648e372d25673ba3c6f2e0b8343f3a5aad","observation_id":"9032f033-466d-4408-bd5f-3777967ffaeb","resolution":{"observed_at":"2026-08-15T20:50:10.626884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T11:18:03.965711Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.01937"},"observation_digest":"sha256:6de5115dc6278718f6cbd3feef75c78295d529c2d175c692b4abc4814bc863ff","observation_id":"07db7b63-fc3d-4db5-8548-104e0b6028c1","resolution":{"observed_at":"2026-05-19T11:22:16.601136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T11:10:45.605360Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators.arXiv preprint arXiv:2407.06551, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-10T13:50:07.438833Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.605360Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:5b1aaf8712d80f7f05b3f383beb3ad31fab666ee3a37ea2c901fe99ebd7ae77c","observation_id":"56114032-d189-4cae-8ef5-06c0cdd39060","resolution":{"observed_at":"2026-08-07T11:10:45.605360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T11:04:06.819184Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.819184Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b014dfb90e39aae37afa461d5e735d337b42c4497cc4667a0dfd087346eab04b","observation_id":"a27bbd21-8242-4092-b6a8-dd026c14e7e7","resolution":{"observed_at":"2026-08-07T11:04:06.819184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T10:17:47.252751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-17T19:45:22.860227Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":287,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.252751Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:5984ecb763c9ebfefcf9fbf711519a4e816b385c65a8409cb01822a8b47c8d60","observation_id":"a6e2eded-492c-4857-b642-92f634971cc9","resolution":{"observed_at":"2026-08-07T10:17:47.252751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T00:31:36.029108Z","title":"InProceedings of the 40th Annual Meeting of the Association for Compu- tational Linguistics, pages 311–318, Philadelphia, Pennsylvania, USA","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13639","last_updated":"2025-06-16T16:04:43Z","snapshot_observed_at":"2026-08-16T19:16:57.442306Z","submitted_at":"2025-06-16T16:04:43Z","title":"An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.029108Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.13639"},"observation_digest":"sha256:3718e53266fa6c73f27ce562e5d87998f8c84bd158b2edb94ec5fbd459648285","observation_id":"c125dec4-740c-4de0-b143-a7f6f052dd4f","resolution":{"observed_at":"2026-08-07T00:31:36.029108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2507.06419","last_updated":"2026-06-04T20:44:16Z","snapshot_observed_at":"2026-08-11T09:29:02.629422Z","submitted_at":"2025-07-08T21:56:33Z","title":"Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T05:16:22.274580Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2507.06419"},"observation_digest":"sha256:8ec094ee336f0f0381e6343cedfa74a1bd1d63b1d6092f524bf99f12eeadc712","observation_id":"0a394f64-376d-46e7-b9ed-4fdaf1a71a9c","resolution":{"observed_at":"2026-05-19T05:17:05.937026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2509.23542","last_updated":"2026-04-19T04:59:30Z","snapshot_observed_at":"2026-08-14T16:14:11.817391Z","submitted_at":"2025-09-28T00:43:52Z","title":"On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T12:53:45.767341Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2509.23542"},"observation_digest":"sha256:97400baa3a3ef911d5b9088054c0a736987f7a07a5b29d18aa38dd83a974a1bc","observation_id":"0448b508-fee8-48e2-aa94-56507906638f","resolution":{"observed_at":"2026-05-18T12:56:24.550549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-03T03:04:44.046679Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators.arXiv preprint arXiv:2407.06551, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:44.046679Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:db37247bbad0bf85ee0b92399e2cadf10312cb420132e8aef2600124122054f3","observation_id":"5ef0d219-294c-4580-92d3-33a2f1d989a2","resolution":{"observed_at":"2026-08-03T03:04:44.046679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2604.03264","last_updated":"2026-03-12T21:28:10Z","snapshot_observed_at":"2026-08-12T19:42:39.254831Z","submitted_at":"2026-03-12T21:28:10Z","title":"SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T11:23:43.022505Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2604.03264"},"observation_digest":"sha256:4efac63c5196e63a40154ebab01b4dc50005af36443f31cd249311e263fef8ac","observation_id":"d2012570-b487-402f-af39-a05be86e5a6b","resolution":{"observed_at":"2026-05-15T11:25:30.934598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2604.23178","last_updated":"2026-06-24T13:27:28Z","snapshot_observed_at":"2026-08-14T02:31:37.751335Z","submitted_at":"2026-04-25T07:18:30Z","title":"Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T08:14:18.535385Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2604.23178"},"observation_digest":"sha256:d1939f09be5c542cff7a69ae6040ae583abce99230c0e63fe9d9eb437f473c53","observation_id":"f60d5783-df58-4dea-be63-361f7b5252de","resolution":{"observed_at":"2026-05-11T20:41:14.032476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":"2407.06551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":"20b54028-d2d7-4967-b675-fe17f61ae06a","year":2024},"citing_paper":{"arxiv_id":"2605.02765","last_updated":"2026-05-04T16:05:40Z","snapshot_observed_at":"2026-08-11T06:25:49.723578Z","submitted_at":"2026-05-04T16:05:40Z","title":"U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:55.849451Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2605.02765"},"observation_digest":"sha256:60ad88990f3fe57868e397a5c83346d0d92bcc54a5f1f831483f835ac22939cc","observation_id":"e7a42db8-9698-428b-85c8-67fa49688360","resolution":{"observed_at":"2026-05-09T06:35:39.061387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.06551/citation-record","integrity":"/paper/2407.06551/integrity","json":"/paper/2407.06551/citation-record.json","paper":"/paper/2407.06551"},"outbound":[],"paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2407.06551."}