{"as_of":"2026-08-14T09:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c62c001eb288af07c87039d591c108e6a48255fd5191e461526bbb04c177d11c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:12:27.792351Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:38:37.969788Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:46:46.529546Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2507.09104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09104","snapshot_observed_at":"2026-07-02T07:46:46.529546Z","title":"Compassjudger-2: Towards generalist judge model via verifiable rewards","venue":null,"work_id":"95afac3e-83f3-405f-851d-7df4b02d4436","year":2025},"citing_paper":{"arxiv_id":"2605.07461","last_updated":"2026-05-08T09:08:07Z","snapshot_observed_at":"2026-08-12T19:55:04.250365Z","submitted_at":"2026-05-08T09:08:07Z","title":"Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:50:50.037018Z"},"links":{"cited_paper":"/paper/2507.09104","citing_paper":"/paper/2605.07461"},"observation_digest":"sha256:dd94cb6e21ff2a948f27e64872dda6af864616e44e2a2a1fdd9bd8e3729a7c5f","observation_id":"09e18a57-e8f8-4d76-8cb1-f03086c96058","resolution":{"observed_at":"2026-05-11T04:20:56.220230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2507.09104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09104","snapshot_observed_at":"2026-07-02T07:46:46.529546Z","title":"Compassjudger-2: Towards generalist judge model via verifiable rewards","venue":null,"work_id":"95afac3e-83f3-405f-851d-7df4b02d4436","year":2025},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2507.09104","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:08898cb726280cd0a9c15475fe1acb8ea16d88376f79a26e6646ee4bcd9d4c51","observation_id":"1a759a44-cc4c-4f97-bd61-83c79b70ff22","resolution":{"observed_at":"2026-05-13T04:57:17.294644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2507.09104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09104","snapshot_observed_at":"2026-07-02T07:46:46.529546Z","title":"Compassjudger-2: Towards generalist judge model via verifiable rewards","venue":null,"work_id":"95afac3e-83f3-405f-851d-7df4b02d4436","year":2025},"citing_paper":{"arxiv_id":"2606.04579","last_updated":"2026-06-22T14:19:37Z","snapshot_observed_at":"2026-08-13T03:34:36.766747Z","submitted_at":"2026-06-03T08:13:27Z","title":"SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T06:38:37.969788Z"},"links":{"cited_paper":"/paper/2507.09104","citing_paper":"/paper/2606.04579"},"observation_digest":"sha256:ced85e54b069d5ce97f9da6254e26b04d544d774f160cf6f49e09a9869f83f75","observation_id":"ce92f95c-8114-4434-93a2-f09526416a7c","resolution":{"observed_at":"2026-07-02T07:46:46.530940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09104/citation-record","integrity":"/paper/2507.09104/integrity","json":"/paper/2507.09104/citation-record.json","paper":"/paper/2507.09104"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-13T04:12:40.677388Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-06T18:12:25.776024Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.776024Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:e51c4004a3ece06ec77aa461a605861d3f3d86117c7992c9d9946ddaa2454899","observation_id":"27e4bece-34d3-4655-b59c-ecbd55ba1e41","resolution":{"observed_at":"2026-08-06T18:12:25.776024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.807108Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":"8117dbf0-50bc-43d5-b32d-9c5ba6d1f546","year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.812538Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:2827dddf2d5fcd03e60c08838c435b3f51cc40f721c262480ff60b343741d8d0","observation_id":"a8229587-89f9-4973-8272-a18480bbe021","resolution":{"observed_at":"2026-08-06T18:12:29.814458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-08-12T22:18:17.243820Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-08-06T18:12:25.845529Z","title":"Compassjudger-1: All-in-one judge model helps model evaluation and evolution.arXiv preprint arXiv:2410.16256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.845529Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:70bf30bb71231963ab548bc659c4d08644d5856a1abf0a89c2f5562a6ae1b8cb","observation_id":"fd88d8ab-459a-4851-a8ea-a196281f8614","resolution":{"observed_at":"2026-08-06T18:12:25.845529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:25.879190Z","title":"xverify: Efficient answer verifier for reasoning model evaluations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.879190Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:1b9757e25915e1719419d03a956ae49839f62b0412940b4badefbad8abf4b4e7","observation_id":"5a244f4a-55b8-4433-9bca-bcbeb8a535f6","resolution":{"observed_at":"2026-08-06T18:12:25.879190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:25.913376Z","title":"Rm-r1: Reward modeling as reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.913376Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:3c95422576c09fc50257472939c909e79886c3a9937827c86d707a7079cbbb19","observation_id":"5eb6f3f5-f2ea-40a4-83e4-8bca12bbe728","resolution":{"observed_at":"2026-08-06T18:12:25.913376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T18:12:25.951994Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.951994Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:45b67e09904a5915c36d873fa6789f38e2328932b86f84bab4c25cc26c34085c","observation_id":"48c74d69-9918-4ca3-b307-9e401294ac89","resolution":{"observed_at":"2026-08-06T18:12:25.951994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T18:12:25.991199Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.991199Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:f304e060a7335cfaa241aa6d2806354224fbb5a026fe689c5dbd2ee1ee010155","observation_id":"7930b945-138f-406a-a80f-7e223673d29a","resolution":{"observed_at":"2026-08-06T18:12:25.991199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.020066Z","title":"Opencompass: A universal evaluation platform for foundation models.https://github.com/open-compass/opencompass, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.020066Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:c2e4d791d2380c3e33656f74725f43e3d0d50ae8eb8068f215c96011a2a8d323","observation_id":"dc3bf25f-644f-44e9-b4d7-b2e32884a422","resolution":{"observed_at":"2026-08-06T18:12:26.020066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-06T18:12:26.036730Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.036730Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:fdea8640d399562ccff1a7ccf60d8ce29152d25b4670a3054e6528841c2cfe36","observation_id":"d7109e07-544e-4427-875a-300a852d6170","resolution":{"observed_at":"2026-08-06T18:12:26.036730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.755342Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs,","venue":null,"work_id":"297f9b3f-488e-444f-95e2-8ed72e042b4c","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.074429Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:c62a0329ed5063b0f0a71116155cb49fd71c2329d6c6209d473d857da9c5ba5e","observation_id":"91a8f682-4fdc-4488-aa2b-87c2bdbc8ea5","resolution":{"observed_at":"2026-08-06T18:12:29.769707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-06T18:12:26.136339Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.136339Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:0a5da688f8d2c471f6b8460ddafb953e753736da38f3d3573f703c8965efc733","observation_id":"5f67fc17-b412-4718-9e5d-bdf7b4b5a5a1","resolution":{"observed_at":"2026-08-06T18:12:26.136339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:12:26.161345Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.161345Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:dfef529f5152ec6b7dcc7b93a401a4f0bdee350e23d9b0dee4ac170463a94c5b","observation_id":"e6d3a2aa-d945-423f-b32c-cef8de7c4e35","resolution":{"observed_at":"2026-08-06T18:12:26.161345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:12:26.192280Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.192280Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:8f4c98fa80da7699d5d95413da8be2647a43550b0723d8cb894a27880f75aef1","observation_id":"9134ff68-0f5c-428b-a629-e43243b37694","resolution":{"observed_at":"2026-08-06T18:12:26.192280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:12:26.225242Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.225242Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:7d6c2dc28a64a8f08279c7a87c69b0fcb025a71122f96080789d14b546e72b44","observation_id":"89da10b7-2134-4928-8d0a-08808659ec0e","resolution":{"observed_at":"2026-08-06T18:12:26.225242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T18:12:26.258243Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.258243Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:3e6aaa86118d4fdbf3837a80e542458d5e467dd84ddd3e66231b18685842791b","observation_id":"5545b802-e87f-4476-8211-b6640beb4990","resolution":{"observed_at":"2026-08-06T18:12:26.258243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T18:12:26.293859Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.293859Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:cb62f6f08891441d1bcc5c5307206ef4e9197d3711237b0b68702052cd24bc54","observation_id":"bf909548-303c-4f02-b969-475d1922f1e8","resolution":{"observed_at":"2026-08-06T18:12:26.293859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T18:12:26.322948Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.322948Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:8d02c4010a517fb372c3a1579f12713cdc567bf98f64b9e0226330887b1da77e","observation_id":"45344ba6-acfd-4334-9793-2a18459719d4","resolution":{"observed_at":"2026-08-06T18:12:26.322948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-13T05:54:10.811176Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-06T18:12:26.348410Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.348410Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:a2169c778b9d4b54d63e140123476ed6791b68e33d8577ac45896c63f230f678","observation_id":"d00481c9-9872-4460-ba2a-3481dbf6bb5f","resolution":{"observed_at":"2026-08-06T18:12:26.348410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-06T18:12:26.373443Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.373443Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:04dbc5aa704c72915a8c3e08ee8b67b9b79b995da0ab8dcf6ae39b475fb51a1d","observation_id":"d6c40686-fd6e-4553-ba9a-5cb72a9223e6","resolution":{"observed_at":"2026-08-06T18:12:26.373443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-12T23:48:02.751889Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-06T18:12:26.407047Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.407047Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:f24cb6dfd26eac6c546fbca16c8c573fcda7421b2d73f6fc45aeb67b505241d2","observation_id":"f42bd137-6ecf-49af-9c2d-538a32a95b5d","resolution":{"observed_at":"2026-08-06T18:12:26.407047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:12:26.432070Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.432070Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:15f223c7613b39f8f0cc74da584ba6dc7172bf1757aa3d31d0b0d6510956a8d5","observation_id":"a5a72ff1-95cc-4ccc-b44a-811e87db24a3","resolution":{"observed_at":"2026-08-06T18:12:26.432070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18743","last_updated":"2024-08-25T09:58:57Z","snapshot_observed_at":"2026-08-13T05:13:04.857556Z","submitted_at":"2023-11-30T17:41:30Z","title":"AlignBench: Benchmarking Chinese Alignment of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18743","snapshot_observed_at":"2026-08-06T18:12:26.444272Z","title":"Alignbench: Benchmarking chinese alignment of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.444272Z"},"links":{"cited_paper":"/paper/2311.18743","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d5716c0daabbf202d835a00f8fde8023a71e849351e41e4b52a37fd3b050f4ac","observation_id":"2285295d-a65f-46bd-b053-39e90300167b","resolution":{"observed_at":"2026-08-06T18:12:26.444272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.459035Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.459035Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d8d9727007d52772bd4357a6c89e36ec4dc15bedb0f8a2f70641a84209fce858","observation_id":"37b0be6b-e5c5-4f9f-b230-041943804558","resolution":{"observed_at":"2026-08-06T18:12:26.459035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.466847Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.466847Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d8c1e90b773a3d2c7bf5812f55b3e698056e7e7b9ef9f783bfa50bd6655c514d","observation_id":"ff6b0cc0-9d3a-4009-94ad-90d0bacab3d3","resolution":{"observed_at":"2026-08-06T18:12:26.466847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.714315Z","title":"Skywork critic model se- ries","venue":null,"work_id":"b55308ec-264d-465d-b743-359a15578d29","year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.498372Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:ac4e0215778d12d41472ea932cea0e3d8806aa6d7edaad92cbed5a0409924ab2","observation_id":"b0341f35-be9f-494e-9a5d-7d227634c76f","resolution":{"observed_at":"2026-08-06T18:12:29.725029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-06T18:12:26.531419Z","title":"Judgebench: A benchmark for evaluating llm-based judges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.531419Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:92ccb875fa668528abb76fb351e4e97c4c5ae9613a15b910bca96f679b20dbda","observation_id":"68938448-2a4b-4ea9-98d3-3cad8e1b3909","resolution":{"observed_at":"2026-08-06T18:12:26.531419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.679128Z","title":"Qwen3: Think deeper, act faster","venue":null,"work_id":"5f8070be-86cd-4818-902c-389ec979577c","year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.554703Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:abf442d34a71dd86e0f735d6094855311e08fbaa306029823a7437de103cff71","observation_id":"d5e015e9-c44e-49ef-a69e-1cb7dff45951","resolution":{"observed_at":"2026-08-06T18:12:29.690604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.567396Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.567396Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:b03f98355660b15edf724ebdc2988c9e6ed85e50c00e34562e02db0a71e088c4","observation_id":"795da8ab-7e65-43f8-a394-5160207ec1b2","resolution":{"observed_at":"2026-08-06T18:12:26.567396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T18:12:26.579312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.579312Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:275d1adc5f37225266d5eae05bc926bfaceb3fed876e620d94813f46d2f9b0cf","observation_id":"d56107c2-04cf-435c-b5e0-09f1b4efae95","resolution":{"observed_at":"2026-08-06T18:12:26.579312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03742","last_updated":"2024-10-13T10:21:29Z","snapshot_observed_at":"2026-08-12T22:33:40.535017Z","submitted_at":"2024-10-01T07:38:58Z","title":"Beyond Scalar Reward Model: Learning Generative Judge from Preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03742","snapshot_observed_at":"2026-08-06T18:12:26.607519Z","title":"Beyond scalar reward model: Learning generative judge from preference data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.607519Z"},"links":{"cited_paper":"/paper/2410.03742","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:442d6dacbc651e062c7c2b661e2382960f0033d3499b6684ab225ca92a79ddc7","observation_id":"18917754-a9e0-4cd7-9bb8-634b69e74c0a","resolution":{"observed_at":"2026-08-06T18:12:26.607519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.631982Z","title":"Learning llm-as-a-judge for preference alignment","venue":null,"work_id":"35feca41-2057-41c4-af8f-8dce9a72ac30","year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.642755Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:72391256c3a80523b7c5309264ce60990966787242bfc99e2f3badb3b8ad8c7f","observation_id":"d6997f2a-8ef3-4a86-bacb-be09c4ac33fe","resolution":{"observed_at":"2026-08-06T18:12:29.645710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11689","last_updated":"2025-09-07T11:12:02Z","snapshot_observed_at":"2026-08-13T01:34:40.195133Z","submitted_at":"2025-02-17T11:28:43Z","title":"Improve LLM-as-a-Judge Ability as a General Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11689","snapshot_observed_at":"2026-08-06T18:12:26.670313Z","title":"Improve llm-as-a-judge ability as a general ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.670313Z"},"links":{"cited_paper":"/paper/2502.11689","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:41098f99e0ad113b86bcc68f359a8ae4e5ae271cefc00f475658f46587f9640f","observation_id":"9bca6223-97c1-4117-b5e5-ea6569d54fe0","resolution":{"observed_at":"2026-08-06T18:12:26.670313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09893","last_updated":"2025-04-04T11:45:02Z","snapshot_observed_at":"2026-08-13T03:31:04.947614Z","submitted_at":"2024-10-13T16:06:54Z","title":"RMB: Comprehensively Benchmarking Reward Models in LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09893","snapshot_observed_at":"2026-08-06T18:12:26.702068Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.702068Z"},"links":{"cited_paper":"/paper/2410.09893","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:cff2930e8d70f93068a4676dd9231d7e1a0c080bc4fb2200c395bbe9e9af5f15","observation_id":"87686c92-4e7f-4a09-a47c-0fcb6213e753","resolution":{"observed_at":"2026-08-06T18:12:26.702068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-06T18:12:26.737680Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.737680Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:61d677894643724d1a7d04b3e815af0a286d7a4c79f470b2e2c656c23220d1f0","observation_id":"5f1839a8-3f0f-422d-b8dd-b5106ee3dee2","resolution":{"observed_at":"2026-08-06T18:12:26.737680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-13T05:39:37.093592Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-06T18:12:26.763993Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.763993Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:6bf695b4ac8055132f25cefd9d00dc117c986dee5d99d2f7e7adee1c8f10d0a9","observation_id":"f79f2ab3-661c-4cde-afaf-718d10fe32d5","resolution":{"observed_at":"2026-08-06T18:12:26.763993Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.593901Z","title":null,"venue":null,"work_id":"a4898649-a643-4db1-8db7-4424f128046b","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.799679Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:fcd1a5cc38fdef4b01a6e2b0286651fe4ac50fc5a8bc868deadfeb7ba3498198","observation_id":"39290a96-bdbd-414f-8930-1f51ff5d31fe","resolution":{"observed_at":"2026-08-06T18:12:29.612393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.569539Z","title":"Consider how well it addresses the user’s demand, meets the user’s constraints, and how well it serves the intended purpose","venue":null,"work_id":"c60f75ee-93ca-4d62-9495-8c0ddefbf3b0","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.834630Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:f8b0e551c9d9939055d689bfb2e0d8d6a6bb07c2ce33c7c82aa7b0d41a6176e7","observation_id":"7bd4b6f4-784d-46d7-a72e-30a8c34b6ebd","resolution":{"observed_at":"2026-08-06T18:12:29.578949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.535877Z","title":"What aspects of the response fail to meet the user’s request or constraints? What could have been improved?","venue":null,"work_id":"0369f4d1-b546-4960-a867-3f3fd6318bc6","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.868124Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d396b4b30bf3c7ebd59d9e85c09bd26b72f5cf18e1f6b8fb929ef78860904f30","observation_id":"69757312-1fbb-4263-b5dc-45a1a4838573","resolution":{"observed_at":"2026-08-06T18:12:29.548703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.491067Z","title":"Consider how well it addresses the user’s demand, meets the user’s constraints, and how well it serves the intended purpose","venue":null,"work_id":"0a9541b8-3b39-465f-a1a0-2e1c8e6d6c1e","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.888800Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:8596cb26e760e47f3c4c3a470d524892dce2f222042420c615ad8d7e4603beae","observation_id":"4fc1365d-f39e-4d45-b641-6d7a7e2ab138","resolution":{"observed_at":"2026-08-06T18:12:29.510120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.445747Z","title":"What aspects of the response fail to meet the user’s request or constraints? What could have been improved?","venue":null,"work_id":"66107c26-e2e8-4094-9f84-587453bdc221","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.921244Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:8b2d15a8492d02e9363f2d01a785c49cf2f468c13b00ddb82d1df5084610786e","observation_id":"19933869-5ee9-4471-9f7f-896d60fd0d03","resolution":{"observed_at":"2026-08-06T18:12:29.457387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.408625Z","title":"Discuss which model’s response is more suitable given the user’s request and con- straints","venue":null,"work_id":"8d218219-b835-4f15-9f53-5f1bfd991213","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.952087Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:25c5c1bf05dd32c1baf410237bfc45b3fd81f96ebcf274898b5e0a82bd0597f9","observation_id":"cafbf833-f115-4365-afba-5190523b1938","resolution":{"observed_at":"2026-08-06T18:12:29.428329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.378517Z","title":"User’s Demand","venue":null,"work_id":"8aa4353b-d034-487b-9ab0-e00da056d219","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.988135Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:0285e33228c638bcb0ccfb233554cdaa14c77951347e1b15e0a5a962e89de653","observation_id":"5e250681-443e-4915-9fe0-d0e4e3906f9d","resolution":{"observed_at":"2026-08-06T18:12:29.391320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.151620Z","title":"hushed, waiting world","venue":null,"work_id":"6373935f-4c71-4e90-b136-00ce8bffdbdd","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.190901Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:6a4fdf752eaca2770d4c3d4acea423b3c23d018c0fea1be522ca6676378dd512","observation_id":"97afeb97-ec0c-4f5a-9392-f99d8ad9989d","resolution":{"observed_at":"2026-08-06T18:12:29.165270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.116273Z","title":null,"venue":null,"work_id":"bb7abc7e-a3f9-4859-9269-284e7af20fa0","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.211614Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:50897da0bce4606d7089101c878bfd9187ce8416bdfa0c7e462c1c085f07211d","observation_id":"9b1d7471-1463-420d-ad97-a81dc080490b","resolution":{"observed_at":"2026-08-06T18:12:29.126628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.071267Z","title":"winter\" or","venue":null,"work_id":"fe974248-cb12-4d11-973c-6ebd3f37c44a","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.237440Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:ef5998efc7304a91cd87f9b281d3abbc9da4249e1800a2460b4479d81739991b","observation_id":"4f1ecb96-0d57-4b53-a581-8d8a9af093e7","resolution":{"observed_at":"2026-08-06T18:12:29.085792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.023382Z","title":"Frost paints silent trees","venue":null,"work_id":"556148e1-c4d3-4298-ada8-cf294cb30ede","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.273350Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:173f4e0d9d2fe3ae604798a431249983c92233921d846af08bdf2db56df5fee2","observation_id":"cb8f08da-78c5-4932-af6a-d324e3f48bad","resolution":{"observed_at":"2026-08-06T18:12:29.039194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.985848Z","title":"Areas for Improvement:","venue":null,"work_id":"bb78f488-d1f3-4924-bffa-a5c362e01b39","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.307975Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:7150f24712cb75d7e72006d02f1abcb0558062061422c009453f3eb4f842b256","observation_id":"a2dc8b3e-b321-45df-ad93-d42e2c5a7526","resolution":{"observed_at":"2026-08-06T18:12:29.000972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.946560Z","title":null,"venue":null,"work_id":"be3b18d6-2740-447c-8ff2-d6540fc11871","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.343975Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:bba489db2296d65cb384de90f06fcf7eb9c0f13bf0f68f70d8bf3c43f0c40b10","observation_id":"f5f50768-320c-4ffe-b633-fb24295d1e6a","resolution":{"observed_at":"2026-08-06T18:12:28.959781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.906549Z","title":"Hushed, the world awaits","venue":null,"work_id":"6d489683-9dd3-4cb4-a418-d23c3b99357e","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.379650Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:bdb2040216075d98bd81a7ebc0af7cd03fb1f772f7a1c6dcf63d6e8b5bdac3fc","observation_id":"4dabcec5-a205-4020-a9fb-8001799c2277","resolution":{"observed_at":"2026-08-06T18:12:28.925905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.870981Z","title":"Overall, the model’s response is a well-crafted poem that meets most of the criteria set by the user’s request","venue":null,"work_id":"ab31245f-eb72-46c4-9aeb-21fc7a51a996","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.406197Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:7ba6dc1f2190c7763f61c1b13e90f1c7cf03c2fdd808d02b4dff4ad9a0cd6801","observation_id":"da3599d4-4a77-42ad-9dd7-21a63ff4dca4","resolution":{"observed_at":"2026-08-06T18:12:28.888987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.344990Z","title":null,"venue":null,"work_id":"9854e1c6-72ff-4053-8126-c29c548e6184","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.442401Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:9408a87895c1fc308689bb30683bb8a70fce3282ef6df2001bcee76bef183549","observation_id":"90a7f719-402d-4232-af37-03bd184a0d68","resolution":{"observed_at":"2026-08-06T18:12:29.360097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.311873Z","title":"winter\" or","venue":null,"work_id":"d967e4cc-4a4d-4aaf-9e5b-2ef56267bce2","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.474519Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:cd17288e3d54543985820f2fcc26afabbcbc43b4b01072079fab29953e292957","observation_id":"3760ca5f-29b7-492b-bafc-66a1f6127621","resolution":{"observed_at":"2026-08-06T18:12:29.326832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.273100Z","title":"Footsteps fade on paths","venue":null,"work_id":"6b320786-1a8f-4f1d-9da8-ff50b9ea9351","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.498619Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:6b37469041a327b03a0de030d9f56c34bc88ea9ca5d62c0836e87ef6cf2c8954","observation_id":"81617923-d253-4bcd-84ee-d0bd20ab08c7","resolution":{"observed_at":"2026-08-06T18:12:29.290702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.234237Z","title":"Snow\": While the user specifically asked to avoid the word","venue":null,"work_id":"63eb0040-51cb-40a2-8fa5-a852d16b9d99","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.524571Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:98c5cd6fac82067eeb03c3bf2653554aa2d70706ec78a84a2daf0841262f9a4a","observation_id":"f99abb23-5c3e-467b-9bb5-56e6d605ded9","resolution":{"observed_at":"2026-08-06T18:12:29.249162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.193947Z","title":"Introducing a bit of variation in sentence structure could add to the poetic quality, such as using a question or exclamation to create a different tone or emphasis","venue":null,"work_id":"cf94741a-c574-4794-af07-9e2182e75e06","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.557622Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:ce2e67333e750e7d54002d3ebc48e850065cd20d5aaa85de4c62284c9fc8a5b2","observation_id":"732feab5-0c52-4947-9755-1c654ff4287d","resolution":{"observed_at":"2026-08-06T18:12:29.211427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.819301Z","title":"hushed, waiting world","venue":null,"work_id":"fc47b13f-8d72-40a7-85c6-266637525f89","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.585953Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:f4dc852d3f6a6662a1611a1f5e712fb425e15e3f5982c923f38ea0c9d2021ade","observation_id":"18639146-0e69-446c-92e3-3d1c6358ea0f","resolution":{"observed_at":"2026-08-06T18:12:28.843893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.786801Z","title":"winter\" or","venue":null,"work_id":"5723cc95-a73e-4d36-a585-636304c38652","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.621485Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:e8afa9017b9aa8d70e248d1581712d0f715c1b1181db787ab6feeb047a84b74d","observation_id":"085ef6eb-93af-49e5-8768-f947b4eee1c3","resolution":{"observed_at":"2026-08-06T18:12:28.802136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.749047Z","title":"Frost paints silent trees","venue":null,"work_id":"94dfd2f3-e026-4c35-ae50-3be051b020c0","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.656931Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:2fcf239b6c23b3346b57640b202f9041319f82d213e7f902d2a25ef0b433b599","observation_id":"2f2578bb-fb20-47d0-ab72-5fd11d05d2d5","resolution":{"observed_at":"2026-08-06T18:12:28.759702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.713796Z","title":"Areas for Improvement:","venue":null,"work_id":"39a0d307-cbf8-425b-b06b-df31ca02675c","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.691320Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:60bd1792569b0a42609187e8b40fa7364257d592cda2b7e4e3a4ecbce4036aef","observation_id":"30f937ea-45dd-497a-9ac0-ab57082168cb","resolution":{"observed_at":"2026-08-06T18:12:28.728416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.646285Z","title":"For example, including different sensory details (e.g., sounds, smells) could make the poem more immersive","venue":null,"work_id":"4f79f90f-b4bf-4ed7-a92d-0d81dd3afc8b","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.712977Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:63e4c55655fa915baf5b02ca77af6b6515f47ec5f3e70e8370118b58e3492af5","observation_id":"fe1a8d83-464b-4755-951f-ae615343ce38","resolution":{"observed_at":"2026-08-06T18:12:28.673946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.614069Z","title":"For instance, a line that hints at nostalgia or anticipation could deepen the reader’s connection to the season","venue":null,"work_id":"4e30b82c-6a65-4abd-b58f-f9bc32dd504e","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.747083Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:7136fab68b9413f8ea9a60c09784931466e2a57298d22c01ee96111bb9cdf705","observation_id":"fcdebfd1-4cf9-403f-b87a-12c4d9483e16","resolution":{"observed_at":"2026-08-06T18:12:28.626009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.567422Z","title":null,"venue":null,"work_id":"2fd06502-3e23-433c-8a1f-8e58affb42a6","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.792351Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:cb670fd09ef40f6227bb3c733decd5b5d2afc5a40efa5d4b6564ba1e143bed82","observation_id":"1fe53379-46ae-4626-bee2-c05fbcf51fc7","resolution":{"observed_at":"2026-08-06T18:12:28.584414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-08-13T15:01:04.000873Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-06T18:12:26.105107Z","title":null,"venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.105107Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:fd3858571de658f7f0fc188076da4a90ac922ff5c47d0154f9c6d6b169a22a7d","observation_id":"88afcf16-237b-40ed-9de4-73d8854d0102","resolution":{"observed_at":"2026-08-06T18:12:26.105107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T03:15:22.165860Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2507.09104."}