{"as_of":"2026-08-17T22:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:211290302e5bb171024904d2e11cd1533fd6f3e48c640fd6e5f4016f165979e2","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:47:45.942549Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:50.298845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:49:38.206304Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-07T15:34:50.298845Z","title":"Atla selene mini: A general purpose evaluation model.arXiv preprint arXiv:2501.17195, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-17T11:40:20.578047Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.298845Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ca135a593fe888bc02ae5c553ef6e469b85d6687b2007e37434fd55dc6b612cc","observation_id":"10d6e181-a23c-4326-a1ea-b681e34819c8","resolution":{"observed_at":"2026-08-07T15:34:50.298845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-07T13:20:16.293260Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22169","last_updated":"2025-09-13T18:08:05Z","snapshot_observed_at":"2026-08-12T20:48:17.823919Z","submitted_at":"2025-05-28T09:40:48Z","title":"ReliableEval: A Recipe for Stochastic LLM Evaluation via Method of Moments","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:20:16.293260Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2505.22169"},"observation_digest":"sha256:8f67be0a24549bab7d531dc45543d8e03af34cfa1184824fdf8babb0e9b7fa52","observation_id":"473fb600-3bd8-4f37-939b-d734da71ea0f","resolution":{"observed_at":"2026-08-07T13:20:16.293260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":"2501.17195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-07-04T06:49:38.206304Z","title":"org/abs/2501.17195","venue":null,"work_id":"aa04d32f-16fd-4993-8e2b-b48afbc9dfa7","year":2025},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-14T05:03:53.674183Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:1951e00787678a59a178acd1cd0835f19dfc55f2a5eb9250345cc276490ad210","observation_id":"b21ac2cc-0103-47d7-a5f5-69cad4632d49","resolution":{"observed_at":"2026-05-18T03:20:49.325679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-03T03:04:43.002417Z","title":"Atla selene mini: A general purpose evaluation model.arXiv preprint arXiv:2501.17195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.002417Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:023b827b69fd6364a7e28784b155c8f5e23f48b95e239452d313316bf714854b","observation_id":"186743ae-0d1a-452e-8e87-9a8674819b32","resolution":{"observed_at":"2026-08-03T03:04:43.002417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-04T05:56:17.811091Z","title":"Alexandru, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08091","last_updated":"2026-08-01T14:08:22Z","snapshot_observed_at":"2026-08-17T17:52:06.745664Z","submitted_at":"2026-03-09T08:32:21Z","title":"Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T05:56:17.811091Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2603.08091"},"observation_digest":"sha256:41209c6750ca29aab22d168a8911515731ed9388c3e2f83468544ab26aca801c","observation_id":"633b275c-4d7e-406b-9fe7-66f5b8e3a17a","resolution":{"observed_at":"2026-08-04T05:56:17.811091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":"2501.17195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-07-04T06:49:38.206304Z","title":"org/abs/2501.17195","venue":null,"work_id":"aa04d32f-16fd-4993-8e2b-b48afbc9dfa7","year":2025},"citing_paper":{"arxiv_id":"2604.12312","last_updated":"2026-04-14T05:42:41Z","snapshot_observed_at":"2026-08-11T10:00:40.156482Z","submitted_at":"2026-04-14T05:42:41Z","title":"CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:00.449776Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2604.12312"},"observation_digest":"sha256:1ea657a482b5a10d7e93ac4a46bcaca63f9f5581555b701b7ff2574ab69e4efa","observation_id":"8646f0f6-5d56-4f6d-8d75-6de409b7d501","resolution":{"observed_at":"2026-05-11T11:26:02.445512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":"2501.17195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-07-04T06:49:38.206304Z","title":"org/abs/2501.17195","venue":null,"work_id":"aa04d32f-16fd-4993-8e2b-b48afbc9dfa7","year":2025},"citing_paper":{"arxiv_id":"2605.11334","last_updated":"2026-05-11T23:39:19Z","snapshot_observed_at":"2026-08-14T11:53:51.676886Z","submitted_at":"2026-05-11T23:39:19Z","title":"VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:29.633350Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2605.11334"},"observation_digest":"sha256:df27705cc18bed1e69b60015670c5fb41b689d9c339502b00189d4cf39a79a36","observation_id":"2c34bab5-fb6a-464f-8d10-984958b188a9","resolution":{"observed_at":"2026-05-13T01:52:05.633574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":"2501.17195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-07-04T06:49:38.206304Z","title":"org/abs/2501.17195","venue":null,"work_id":"aa04d32f-16fd-4993-8e2b-b48afbc9dfa7","year":2025},"citing_paper":{"arxiv_id":"2606.01034","last_updated":"2026-05-31T05:50:27Z","snapshot_observed_at":"2026-08-12T13:56:18.327676Z","submitted_at":"2026-05-31T05:50:27Z","title":"A Finite-Calibration Regime Map for LLM Judge Panels","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:28.258222Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2606.01034"},"observation_digest":"sha256:b61a9a457d6637f0871a79ec961bba742bd1e5fe3e2a324c610d597908936b48","observation_id":"2d4c3f1a-13ab-4a46-ba7c-0ad48e2eb519","resolution":{"observed_at":"2026-07-01T21:06:13.157300Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":"2501.17195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-07-04T06:49:38.206304Z","title":"org/abs/2501.17195","venue":null,"work_id":"aa04d32f-16fd-4993-8e2b-b48afbc9dfa7","year":2025},"citing_paper":{"arxiv_id":"2606.03128","last_updated":"2026-06-02T04:13:43Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T04:13:43Z","title":"Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T09:58:30.611774Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2606.03128"},"observation_digest":"sha256:389e83ea345dd7082314eb15fd22315c153b00ed2bc9c7bff6937c1aa39bc446","observation_id":"b61684d5-7b12-4020-adf8-8846be308705","resolution":{"observed_at":"2026-07-02T03:26:29.997093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":"2501.17195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-07-04T06:49:38.206304Z","title":"org/abs/2501.17195","venue":null,"work_id":"aa04d32f-16fd-4993-8e2b-b48afbc9dfa7","year":2025},"citing_paper":{"arxiv_id":"2606.21627","last_updated":"2026-06-19T17:30:56Z","snapshot_observed_at":"2026-08-12T12:40:34.526392Z","submitted_at":"2026-06-19T17:30:56Z","title":"Counsel: A Meta-Evaluation Dataset for Agentic Tasks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T14:07:59.446478Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2606.21627"},"observation_digest":"sha256:519d83da063184dc9487aac41c73939734160661791804a2c752f4af613e66fe","observation_id":"a097e6de-8e70-4f5b-b512-32b3998d4134","resolution":{"observed_at":"2026-07-04T06:49:38.208141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-01T19:02:46.756858Z","title":"arXiv preprint arXiv:2501.17195 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17117","last_updated":"2026-07-19T08:07:32Z","snapshot_observed_at":"2026-08-14T20:24:43.518178Z","submitted_at":"2026-07-19T08:07:32Z","title":"Persistent Sparse Autoencoders: Learning Feature Timescales in Language Models","version":1},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-08-01T19:02:46.756858Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2607.17117"},"observation_digest":"sha256:67c5740f581211c065019d55cd1e3ba6f797fdb631e83573913b40e8221f691e","observation_id":"69427740-b102-4ced-8a95-6852b925c18c","resolution":{"observed_at":"2026-08-01T19:02:46.756858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-03T17:29:12.599582Z","title":"arXiv preprint arXiv:2501.17195 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28908","last_updated":"2026-07-31T00:15:32Z","snapshot_observed_at":"2026-08-14T00:02:21.147698Z","submitted_at":"2026-07-31T00:15:32Z","title":"Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T17:29:12.599582Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2607.28908"},"observation_digest":"sha256:e78f170cf6b4b722a6ca336a0f51a340de6fc9596f51dacf4303983d079cf849","observation_id":"1072ece7-ec15-493e-843c-e6c2c3ebaf38","resolution":{"observed_at":"2026-08-03T17:29:12.599582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.17195/citation-record","integrity":"/paper/2501.17195/integrity","json":"/paper/2501.17195/citation-record.json","paper":"/paper/2501.17195"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-10T13:47:45.742177Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.742177Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:8c30b6c142875fc0b189bd2d1af2d58bb3e0456061a3b17c2591aa4998da324d","observation_id":"5955838e-8963-437a-8e44-d5305b984b90","resolution":{"observed_at":"2026-08-10T13:47:45.742177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-16T14:34:35.228009Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-10T13:47:45.748385Z","title":"Weak-to-strong gener- alization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.748385Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:02e2f163eec39cd77c0dc98112ac911a894cdd2e132e11ffd1fcd662744ca58b","observation_id":"924147ce-03bf-488d-8607-451c7c70fadb","resolution":{"observed_at":"2026-08-10T13:47:45.748385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:45.755134Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.755134Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:a88664f22e7814b9d23216598ee7e668f134dbb9eff4235d70a8c2a565fc0393","observation_id":"15e59109-531f-47ce-bf4b-6e89b8147eda","resolution":{"observed_at":"2026-08-10T13:47:45.755134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.816758Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators, 2024","venue":null,"work_id":"f10ee6d5-c3c7-420a-8ae8-9eca0d9f722b","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.761709Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:69e1ceff591d9ec55b19e1bbd5c66c0d7cebfb98be23a0216b080bd80495ab81","observation_id":"d519f7cc-c2a7-402f-b96e-64bc54789c1f","resolution":{"observed_at":"2026-08-10T13:47:46.821317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.802107Z","title":"Self-preference bias in llm-as-a-judge, 2024","venue":null,"work_id":"e3ea8b67-5421-4e21-8d74-b2b4812d4431","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.768791Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:533827c82f92f1ec1827c2ccd9896f5178836f49441c48d2db953472e98e7ed7","observation_id":"6c88dab8-23fa-4195-bb04-d7bf001ddc41","resolution":{"observed_at":"2026-08-10T13:47:46.806539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.786305Z","title":"Judging the judges: Evaluating alignment and vulnerabilities in llms-as- judges, 2024","venue":null,"work_id":"159901b1-cb3f-44e2-bcec-33ead0cfa8a4","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.774292Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:c31b4fd7013b3a5c25bb43201f286c2363635866f49c94af823b0eda34400891","observation_id":"cac79179-7a51-442e-b6f6-01a4143307a7","resolution":{"observed_at":"2026-08-10T13:47:46.792124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10817","last_updated":"2024-07-15T15:33:45Z","snapshot_observed_at":"2026-08-17T16:57:27.503640Z","submitted_at":"2024-07-15T15:33:45Z","title":"Foundational Autoraters: Taming Large Language Models for Better Automatic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10817","snapshot_observed_at":"2026-08-10T13:47:45.780674Z","title":"Foundational autoraters: Taming large language models for better automatic evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.780674Z"},"links":{"cited_paper":"/paper/2407.10817","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:4f8da0a8266b9ceb1bfefe9bc2f45b09e7d69b24ff2f24cccc2f35d8adf0fbbb","observation_id":"a5d8d982-0432-454c-835c-fff7d9de49e3","resolution":{"observed_at":"2026-08-10T13:47:45.780674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.769278Z","title":"Flow judge: An open small language model for llm system evaluations","venue":null,"work_id":"b1db2cf9-11ed-437c-bbbe-e02bc9516720","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.786833Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:ee9d4f9a07f378c5e5fd319feb55a73bdba7c424c21376d060105855f7477720","observation_id":"a2390a24-5fb5-4bac-a135-ebf499258bde","resolution":{"observed_at":"2026-08-10T13:47:46.774775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14140","last_updated":"2024-12-20T21:59:56Z","snapshot_observed_at":"2026-08-15T16:14:36.378413Z","submitted_at":"2024-12-18T18:41:12Z","title":"GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14140","snapshot_observed_at":"2026-08-10T13:47:45.791540Z","title":"Glider: Grading llm interactions and decisions using explainable ranking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.791540Z"},"links":{"cited_paper":"/paper/2412.14140","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:199e34f8b0eed61c07c5ae1e4d52e3158fe2a5d873eaed02e2e38160d7c7d43a","observation_id":"2869b014-b550-48a7-bd40-2d92ac4ddaf2","resolution":{"observed_at":"2026-08-10T13:47:45.791540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14664","last_updated":"2025-09-12T17:21:39Z","snapshot_observed_at":"2026-08-16T13:16:25.609270Z","submitted_at":"2024-09-23T02:08:20Z","title":"Direct Judgement Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14664","snapshot_observed_at":"2026-08-10T13:47:45.796976Z","title":"Direct judgement preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.796976Z"},"links":{"cited_paper":"/paper/2409.14664","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:004154dab1c913a2d7daeb72513fb6a9d1de517b13512991bba496894e59dbe7","observation_id":"d408f67e-3710-4adc-ac61-8548b048e9de","resolution":{"observed_at":"2026-08-10T13:47:45.796976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-10T13:47:45.802686Z","title":"Prometheus 2: An open source lan- guage model specialized in evaluating other language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.802686Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:4daa3dadf02408e64c76f5368bbb8616ec5da96e68787c1db4de67e4fc51021b","observation_id":"79e9433a-0aff-4a2c-b88b-8e9db9716d59","resolution":{"observed_at":"2026-08-10T13:47:45.802686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.748853Z","title":"Judge arena: Benchmarking llms as evaluators","venue":null,"work_id":"b3a9193d-8a50-422f-8bcb-164a0d94fca7","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.809130Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:e89f618831f1ae1cd832afc2852af759ff6e0c73ec457752ea16cad9d02182cc","observation_id":"12270fef-1e97-4658-95ee-b5862f1abbf8","resolution":{"observed_at":"2026-08-10T13:47:46.756546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-16T13:56:31.553308Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-10T13:47:45.815883Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.815883Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:b0e4550a9088f5cd900f7e9372fc51f9f1af1663be5dd9a0dedf1cc08229a06b","observation_id":"09b82bed-2fbb-47d1-b17f-9d9bc1733cac","resolution":{"observed_at":"2026-08-10T13:47:45.815883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-16T13:41:43.608449Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-10T13:47:45.821883Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.821883Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:dfbe9355eb696d550508fa74ba4249814d9ccd4335a499a376ceecb4352e7e5a","observation_id":"b1bdb19a-0c51-4eb1-9ac9-686627d8924a","resolution":{"observed_at":"2026-08-10T13:47:45.821883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:45.830201Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.830201Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:5b345d1d86bd2c10bff6d5f68e395e9c77ccf476ff5ca04e98bbcd6b4c5a8de7","observation_id":"e00fff85-a96b-423f-9fbd-6aaf8643d522","resolution":{"observed_at":"2026-08-10T13:47:45.830201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.717089Z","title":"Flask: Fine-grained language model evaluation based on alignment skill sets, 2024","venue":null,"work_id":"09dffe46-a991-4370-a5df-13621c50473a","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.835083Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:794ac23d47e4758c3bd3efefc3750e47761bc43f3c019807e1dec30994d3dc1b","observation_id":"b353b3fb-05f6-4310-b62c-8513b57a9903","resolution":{"observed_at":"2026-08-10T13:47:46.723017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.700144Z","title":"The biggen bench: A principled benchmark for fine-grained evaluation of language models with language models, 2024","venue":null,"work_id":"4de4dc32-c880-4bb6-9624-5616c127e2e5","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.840992Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:89141820d83b46c38efb7a1c7c54ff81dce9fce49043408ccbe3b95348c7fbe9","observation_id":"c800eb55-f596-45a7-a26b-c4b0e6da3766","resolution":{"observed_at":"2026-08-10T13:47:46.705680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:45.846708Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.846708Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:363d4e449a1aab5dc46f1e9d8f32cd4d1f5107e4f6449bd44602e7670a7267e5","observation_id":"70d8b0b6-2769-4a06-8e26-40ac8621153f","resolution":{"observed_at":"2026-08-10T13:47:45.846708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.667950Z","title":"A critical evaluation of evaluations for long-form question answering, 2023","venue":null,"work_id":"72e807f8-318e-421f-8fed-f7d4afba38a2","year":2023},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.852047Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:5e8d374c01721138e1847cd6bdb991003d9345c66f8a7ab7feb3ed1b45e66de3","observation_id":"50873398-0189-4be5-8d51-ad421f06022e","resolution":{"observed_at":"2026-08-10T13:47:46.673556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:45.857961Z","title":"A general language assistant as a laboratory for alignment, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.857961Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:405ae13b875a7e539dc0ec983bf741e61ef012ed40267a69d2a3ff7dc15d42f4","observation_id":"4bb91bf5-4d9a-4df5-ad71-464c7a70840f","resolution":{"observed_at":"2026-08-10T13:47:45.857961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.639953Z","title":"Fabbri, Jiawen Chen, Yilun Zhao, Simeng Han, Shafiq Joty, Pengfei Liu, Dragomir Radev, Chien-Sheng Wu, and Arman Cohan","venue":null,"work_id":"cfdad61f-f91e-4c80-9c09-b61123f735d8","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.866016Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:92f0dd920c9e7097a6ab50dd60a44dda6ba3c2688a7cf517cc5c3863a211a078","observation_id":"abc8f2af-4af7-4261-8d7b-c02e1e611dad","resolution":{"observed_at":"2026-08-10T13:47:46.645533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.624948Z","title":"Generative judge for evaluating alignment, 2023","venue":null,"work_id":"5a30c5bc-3b64-4611-a968-33e46581cdda","year":2023},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.870979Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:60845203630c84b21e6560a928db8b9bb099c1bb3f8553798d7b1cd72d019030","observation_id":"6b21a0c0-0721-4d53-a68e-04f0535a4f07","resolution":{"observed_at":"2026-08-10T13:47:46.629644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03601","last_updated":"2024-01-07T23:01:56Z","snapshot_observed_at":"2026-08-16T14:29:15.925039Z","submitted_at":"2024-01-07T23:01:56Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03601","snapshot_observed_at":"2026-08-10T13:47:45.877232Z","title":"Infobench: Evaluating instruction following ability in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.877232Z"},"links":{"cited_paper":"/paper/2401.03601","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:1c582bd85f84922ab77567fb333cf46b4147645f1401b495c378a990fa3363f2","observation_id":"146b0000-1fe2-4c00-92bd-13c45b35aba3","resolution":{"observed_at":"2026-08-10T13:47:45.877232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.607255Z","title":"Minicheck: Efficient fact-checking of llms on grounding documents, 2024","venue":null,"work_id":"1dfa30db-7c11-45b3-a426-67881fdc9cf1","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.883625Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:ae8e32bfaaec53a2050c6af65df557c78c316568c169cb1f7c457d1da4710346","observation_id":"99354afd-5543-4c5d-8395-9c962c2ebbb4","resolution":{"observed_at":"2026-08-10T13:47:46.613654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.555730Z","title":"Craft-md: A conversational evaluation framework for comprehensive assessment of clinical llms","venue":null,"work_id":"0acbc3ae-d903-4a9b-9685-d86eaeb8ea29","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.888820Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:fa9fcc9f549763672110c01651c400b83c225417205a7212b5c9fd5f357c2bf7","observation_id":"871b8494-0aa9-4bb1-9b05-6f1697567fb6","resolution":{"observed_at":"2026-08-10T13:47:46.584750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-08-13T18:35:52.271946Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-10T13:47:45.898085Z","title":"Financebench: A new benchmark for financial question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.898085Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:ddd4cf697f2aa02d49dbc53a9d7096615e6cf01196c88fd7cd3b9b33d0dfc994","observation_id":"d860d53e-dff1-4508-a5d6-5993a8ef79a6","resolution":{"observed_at":"2026-08-10T13:47:45.898085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.467197Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates, 2024","venue":null,"work_id":"2a3c5c4e-f8e2-46e5-8985-509af50445b0","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.904118Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:03cb96e6d1f8e05bed54eba2895fb36dedf991be569f88d10ea78a7ac55a0a71","observation_id":"a849a26e-062b-4851-8560-102b7525e6fc","resolution":{"observed_at":"2026-08-10T13:47:46.484769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.423259Z","title":"Does prompt formatting have any impact on llm performance?, 2024","venue":null,"work_id":"e11e705c-3f00-44c6-8c2f-84513ac91699","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.909136Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:3f7d9175d50a40ed3b8be25af9ac4ca8ad00f40b81a17274b70919a47e220138","observation_id":"b807122d-c6e6-4330-8f30-2add5ee06b06","resolution":{"observed_at":"2026-08-10T13:47:46.429889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.398925Z","title":"The comparative trap: Pairwise comparisons amplifies biased preferences of llm evaluators, 2024","venue":null,"work_id":"92214443-e558-4aed-a378-d271620e65bc","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.914857Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:14ef749b5644526f3cd6409f6b6082325142267533434ec27bf3533ade44cddf","observation_id":"4b79dd25-cc73-46e2-a05c-1847f9c7df36","resolution":{"observed_at":"2026-08-10T13:47:46.403937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T13:47:45.920196Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.920196Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:fdff93ca919223dbadc4628557375226da11eab55d476afd1fd72ff23d7d52f2","observation_id":"dd667c32-6ed3-4b0b-aa00-338f0240b428","resolution":{"observed_at":"2026-08-10T13:47:45.920196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-10T13:47:45.926401Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.926401Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:45c4a5f33c603c36b6396539bef29654ab8645ec9aa26170b3472d722a916760","observation_id":"46e1c7a0-247e-4f59-a187-02305a63d8f6","resolution":{"observed_at":"2026-08-10T13:47:45.926401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.381218Z","title":null,"venue":null,"work_id":"0688566c-ba17-489f-b744-01e5870e3aa9","year":2025},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.932717Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:c18f5f40c1e1dc775b4eb314eed9e17c0012f3ef98ccf7a19afca5dcd190a591","observation_id":"fa086e8d-5142-4f1e-aef1-7db168a90d00","resolution":{"observed_at":"2026-08-10T13:47:46.386336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.364025Z","title":"Nomic atlas","venue":null,"work_id":"430ae689-bd33-496a-80e3-cc3e72e6ee0e","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.937602Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:738aee3d968399c09ab178ec906ab201a01492031e9771e2b338d68ae45f49d6","observation_id":"05bc346a-6d67-43c4-82d9-a00004dc7779","resolution":{"observed_at":"2026-08-10T13:47:46.369292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:46.337593Z","title":"\"Dear Readers, <omitted for conciseness> P.S. No garden gnomes were harmed in the writing of this book","venue":null,"work_id":"b57b79f7-73df-4dee-a3f7-a92bb4341ccc","year":2024},"citing_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:45.942549Z"},"links":{"citing_paper":"/paper/2501.17195"},"observation_digest":"sha256:c4beba46f915ee6dca6ab14790c364455ced284245b091c069a6bff57ad94b62","observation_id":"198cdc71-4ff9-4f27-a514-e71f8c8d65c3","resolution":{"observed_at":"2026-08-10T13:47:46.348249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T05:47:32.830861Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 12 inbound Pith citation observations for arXiv:2501.17195."}