{"as_of":"2026-08-10T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9f6d347106b9d152509556cb659b65976ac644c8c45a66b5a7b5aa8fdcdb851","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:12:29.571807Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16003/citation-record","integrity":"/paper/2505.16003/integrity","json":"/paper/2505.16003/citation-record.json","paper":"/paper/2505.16003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:25.658857Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.658857Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:ff1ea4827b1daaa7c570341b475721ad4417996e51cb189730538ba379d42d8a","observation_id":"2331853a-80d1-42d9-8ad9-41e293a902c0","resolution":{"observed_at":"2026-08-07T15:12:25.658857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:25.739049Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.739049Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:ad1496e9df6627c5d65567442f1e53028c0365f9495ad8666bf86ae6d66f36ab","observation_id":"2a9960b7-6162-43a6-ac18-07f7b76bddf7","resolution":{"observed_at":"2026-08-07T15:12:25.739049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T15:12:25.831066Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.831066Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:8fb128100685cedd0097fd62c101d5000e97ab839d69f5f0769df7bafa0777a1","observation_id":"52ecad51-fff3-47d0-b2cc-35ca9de06c2a","resolution":{"observed_at":"2026-08-07T15:12:25.831066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:25.937380Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.937380Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:11a64f0f46ecaa9ab00e3260a78cdc28c6edaf42a8f6537e08407bd6e192fa1c","observation_id":"6993e9f6-276a-409e-a54f-5dabc51d287e","resolution":{"observed_at":"2026-08-07T15:12:25.937380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-07-06T06:30:55.970076Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-07T15:12:26.041434Z","title":"John, Noah Constant, Mario Guajardo-Cespedes, Steve Yuan, Chris Tar, et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.041434Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:695afe22952e324da42f41c657dda04ef895403e1172e6d9785f449dbe0f83be","observation_id":"2f7a7b0f-86d7-45c9-85e4-9e08054b9e05","resolution":{"observed_at":"2026-08-07T15:12:26.041434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:26.152173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.152173Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:be1b4f83b5c22217d3414a0b68829204666fe37a9cdc5301f71e68a8a1e01ea9","observation_id":"d44d9ea7-01c1-4868-a17d-2dc018b5bd47","resolution":{"observed_at":"2026-08-07T15:12:26.152173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:26.253084Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.253084Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:41c913ed785a64ef0398db86abfc65fbece11223ad53aae53b157e1bf0d23bc9","observation_id":"2eef658f-6295-46d0-8840-4e0c2b3a82ee","resolution":{"observed_at":"2026-08-07T15:12:26.253084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T15:12:26.305835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.305835Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:dc97f997a7a2f3eb9deef76510d8a99134c33413b9ad7e81cb27587286861a43","observation_id":"ef2a6eca-65e3-4fba-a07a-73e4a615faa9","resolution":{"observed_at":"2026-08-07T15:12:26.305835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14483","last_updated":"2025-02-17T16:21:10Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-19T20:16:26Z","title":"Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat","version":2},"cited_work":{"arxiv_id":"2411.14483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14483","snapshot_observed_at":"2026-08-07T15:12:29.896082Z","title":"Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat","venue":"cs.CL","work_id":"48b31600-0582-4031-aeae-3bdec4d0b980","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.391373Z"},"links":{"cited_paper":"/paper/2411.14483","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:34241f098dda518479e9c67edfb47f0074fbb76171bd5724067aa1b84bf96f6c","observation_id":"c7de3eed-8795-47f5-ba78-8065e605404f","resolution":{"observed_at":"2026-08-07T15:12:29.990097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T15:12:26.461346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.461346Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:490118909e96583e072d491f56c9171d4824b9f4d19964668ef3707b63c49bab","observation_id":"588ea92b-1523-413a-8b23-9d3e7f2139c5","resolution":{"observed_at":"2026-08-07T15:12:26.461346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T15:12:26.533391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.533391Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:7a4961d4e969a1a29fc90f0fdc4c3367bacb29889a390330cc67d42159a77368","observation_id":"6391e006-8c47-4db5-870d-d993cd5cd9e7","resolution":{"observed_at":"2026-08-07T15:12:26.533391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:26.612947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.612947Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:7e0c6dd8929e54f0e6cfa5857f0a50a11cc977eacf2c12cec7d22af2190a22e0","observation_id":"4a6d97c4-0639-49af-b3dd-fbd0d67e750b","resolution":{"observed_at":"2026-08-07T15:12:26.612947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.753743Z","title":null,"venue":null,"work_id":"af5da921-9cb2-4839-a2aa-b00aa11bd87b","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.683431Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:a12c5fd071b6a7aa07017de81ff3193aa8976251462b13136c5295e92bdfca51","observation_id":"cfb6063c-b19c-45ab-9568-b34878d6a3bf","resolution":{"observed_at":"2026-08-07T15:12:32.813694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.613189Z","title":null,"venue":null,"work_id":"4f1a5d21-4bc1-4aaf-b6c5-e500791b7026","year":1957},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.786899Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:8cc481656fe69e3fc0800ccb7c2b85305691fe196d4b0141de9a0707687ec0e1","observation_id":"743a2d8e-f7b9-452b-9da9-cf64f60f9ac0","resolution":{"observed_at":"2026-08-07T15:12:32.684513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T15:12:26.903646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.903646Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:9017924a95307ec284f706feb9f9f71e12212cb08831853b1138151994e861aa","observation_id":"2de9dde4-b320-4095-864b-2187a14f885d","resolution":{"observed_at":"2026-08-07T15:12:26.903646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:12:27.086999Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.086999Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:8c9beabd7fd4d806bae045893c309cca0f3eb466860b0ce72930773c9c21d501","observation_id":"adefd4fa-c694-4e8c-a0c3-8e9f8497fb8f","resolution":{"observed_at":"2026-08-07T15:12:27.086999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.456704Z","title":null,"venue":null,"work_id":"e55ef13f-c1cd-42d2-b5fe-bcffa89f066b","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.235305Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:5d65511b8de00ca3f2d9b7fadfa6ce5eca4084a00fa7a5af5ebb3122c3f0f30b","observation_id":"4ba73291-d785-4c5f-94cd-3aaa3bad7a41","resolution":{"observed_at":"2026-08-07T15:12:32.526639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.360715Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.360715Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:edc0bdda7f7cd206d31d3ae4582f3a8209488fd361d03b83004e19f81b858890","observation_id":"33cfb1ef-67b4-4bfc-b3a4-b89233fc699f","resolution":{"observed_at":"2026-08-07T15:12:27.360715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.479046Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.479046Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:ebd8b2d327072304f4af77457281e1953dc5e2cb4fdf039f4d9ec9d3095c926f","observation_id":"65a77ac2-aa0c-467a-8685-ddde52a27896","resolution":{"observed_at":"2026-08-07T15:12:27.479046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.560332Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.560332Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:a2076b49b2e838018774d4be22a86e4e45a600f6ad18462504bde784d2024694","observation_id":"e4270a75-42da-4e5c-aff9-c3d529819601","resolution":{"observed_at":"2026-08-07T15:12:27.560332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.639556Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.639556Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:4933359f754a34cefe252d972eeddcc382962058561b706290aacb45f17007c4","observation_id":"2ba855eb-b404-47c9-bc1b-ae595c6277a4","resolution":{"observed_at":"2026-08-07T15:12:27.639556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.196963Z","title":null,"venue":null,"work_id":"6c5b0e9c-7ec2-46c9-bba9-b42ac91c3fe8","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.733477Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:9ea4bb01605ba92f2af0561d23f65a6fa0de8c1d13bd9762d513da130e02f8b6","observation_id":"8ae85e7e-8cb9-4496-9a67-de0ce603873a","resolution":{"observed_at":"2026-08-07T15:12:32.309222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-08-09T03:30:58.801577Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-07T15:12:27.821363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.821363Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:60e0c35f71983d74b43d787b6f0038b6895206b41beb3cbaaa423f05c01c9fa8","observation_id":"981f289b-cdca-4199-b00b-8f5b4671d088","resolution":{"observed_at":"2026-08-07T15:12:27.821363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T15:12:27.917379Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.917379Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:60718d3af08d89408d2a0a6f8768c6784d2c57566854f0b15b2b60012fbc8108","observation_id":"e954545d-c994-4d24-b407-199e4caeab6a","resolution":{"observed_at":"2026-08-07T15:12:27.917379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.029463Z","title":null,"venue":null,"work_id":"8ebaf736-a1b2-443a-8699-5b6c9001aa00","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.007655Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:374ef31ac2802b989e7fe43f619744df2471f70351afd69ec819a0bc85cf021b","observation_id":"a0acaae3-8679-4ec0-af48-3dc5a8fd6068","resolution":{"observed_at":"2026-08-07T15:12:32.098337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.093858Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.093858Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:73d68e5cc2b03daed809f33192dcd339510a69b43aa1f562782658e04b8a9ecc","observation_id":"cb03803f-ca61-4365-a874-d2b479169fc2","resolution":{"observed_at":"2026-08-07T15:12:28.093858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.207619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.207619Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:7af19f2909ccb4d0ab394fe0e70b7741e713d9335bffd0a41efa9d8b1c54737e","observation_id":"b4ed41ef-69dd-4d2e-a33c-1fbd04d572f3","resolution":{"observed_at":"2026-08-07T15:12:28.207619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.832362Z","title":null,"venue":null,"work_id":"c870a8e0-7bf0-442a-9aa5-69418d122259","year":2011},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.302685Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:ba88d2055eac3a45c57bb219a46c61135b09d4499e281eb13ae907e7020d292c","observation_id":"ffe05389-17d4-42a9-9598-134c942f598d","resolution":{"observed_at":"2026-08-07T15:12:31.912194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T15:12:28.393971Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.393971Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:ee5d4e802e1f493c79e8cf5726dd6080994369ebe91220f0af89ff0e239e56ff","observation_id":"00f127c3-6873-4e41-885e-a0eac26076c7","resolution":{"observed_at":"2026-08-07T15:12:28.393971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.581510Z","title":null,"venue":null,"work_id":"61708eb9-c38d-40f7-b560-11a771674884","year":2020},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.577137Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:808b373a89fc94e77d3498bc3d738833e63c10f776a053a0020b134a81cdcf0e","observation_id":"6d5c4745-242c-48aa-a1e5-de35b8af9224","resolution":{"observed_at":"2026-08-07T15:12:31.726627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.347372Z","title":null,"venue":null,"work_id":"6ee80b13-b7ff-42a4-a1a2-1b51ca9836ce","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.676722Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:8af3d2d949b3a459a53dabc26887fce7c37df98360abd1678466fa5ea956ba5b","observation_id":"3c0e25e3-1218-42c0-9a7d-58c01a506aff","resolution":{"observed_at":"2026-08-07T15:12:31.451979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.107375Z","title":null,"venue":null,"work_id":"077e079a-f0a5-4ed3-8f3e-fee12ff6f189","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.773948Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:0319a41da2ce4352a33a456bcff97d693ff08eabbe2205d3346c4a36fcb41ee9","observation_id":"9cb6822f-e160-4545-b196-630e9a87a131","resolution":{"observed_at":"2026-08-07T15:12:31.207916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:12:28.875787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.875787Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:b3e44e6b2eb98fda50bf0ff9ec958df8bb5738b6a42f14b9d04538e5658c2bdc","observation_id":"32cc10a8-2041-42e1-9998-9b4e05193277","resolution":{"observed_at":"2026-08-07T15:12:28.875787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-07T15:12:29.013619Z","title":"Rush, and Thomas Wolf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.013619Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:f4ef41e90bc9d73a8316e1ec9f81f995e82b9d501c447117745afb0ca22516cb","observation_id":"e448977d-df40-4b70-8f29-ad110807bdec","resolution":{"observed_at":"2026-08-07T15:12:29.013619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.824353Z","title":null,"venue":null,"work_id":"4ba4883c-f4db-41b5-aaf4-26ee609bc833","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.142511Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:9aa261003a0e3cccaeb465adece47dbd842ffaad9475db2a5e5e9f7c049b4331","observation_id":"669009f8-f223-4ab5-aa28-d0d10212fcf9","resolution":{"observed_at":"2026-08-07T15:12:30.958495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.580116Z","title":null,"venue":null,"work_id":"d4466f89-dcc9-458a-a358-29974ab7a363","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.232866Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:435ea3dddc6cf766371f0e9ffe0bc347cd04ea5c15026539afa4372dad1c22bf","observation_id":"6fefe809-a7d4-4520-80ee-eba385d346a7","resolution":{"observed_at":"2026-08-07T15:12:30.712074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.390892Z","title":null,"venue":null,"work_id":"0d475841-6547-434d-a996-0828763b4b4b","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.322869Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:fdfc544ad805bb301c10d61f7612f34f2328287824a474e2ef2734e87fbc4622","observation_id":"233aca80-98c1-4697-a4c2-40f0971fa555","resolution":{"observed_at":"2026-08-07T15:12:30.464148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T15:12:29.411802Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.411802Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:b0785506129a163f18fada74bd1bcb77895101b2df9c15421c9993f8f7da7a76","observation_id":"3f8693bb-69cc-43c6-85c4-c5167420173c","resolution":{"observed_at":"2026-08-07T15:12:29.411802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.473657Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.473657Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:667822a00b4bfc436bca6aa5413acfebd5eb02a10338e93a5353b9ab60f9fa84","observation_id":"e6dd55c4-ea95-4649-8580-49d0d90f584c","resolution":{"observed_at":"2026-08-07T15:12:29.473657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.156235Z","title":null,"venue":null,"work_id":"259e6005-34cc-4f4b-abed-420a5e7381c4","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.571807Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:2b5d98de6513ddf13456455d9a5c433dd121db0b6eaaa6a9873fb4dad8caf97b","observation_id":"ee1e615a-d8b2-4c2e-919b-42b72b672d4f","resolution":{"observed_at":"2026-08-07T15:12:30.216253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T20:48:03.858367Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.16003."}