{"as_of":"2026-08-20T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2cd27c86f29bd25300e06ecf1605a08833a3db075164fee311f3c95acbefbec7","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:01:23.023749Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T04:49:15.239636Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T04:52:17.135964Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"cited_work":{"arxiv_id":"2506.18082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18082","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical multicriteria evaluation of llm-generated text","venue":null,"work_id":"b8053304-2de4-4a82-a93c-268a685b7ea8","year":2025},"citing_paper":{"arxiv_id":"2605.12208","last_updated":"2026-05-28T06:21:29Z","snapshot_observed_at":"2026-08-11T16:40:32.163269Z","submitted_at":"2026-05-12T14:46:08Z","title":"Self-Supervised Laplace Approximation for Bayesian Uncertainty Quantification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T04:49:15.239636Z"},"links":{"cited_paper":"/paper/2506.18082","citing_paper":"/paper/2605.12208"},"observation_digest":"sha256:3d98bb7388313635f5f3cc67ad3bf55b626823fa3d0977a9037f676ff3ebcc3c","observation_id":"9b8b12fd-8aec-424e-83be-138f89dee1bc","resolution":{"observed_at":"2026-05-13T04:52:17.137374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18082/citation-record","integrity":"/paper/2506.18082/integrity","json":"/paper/2506.18082/citation-record.json","paper":"/paper/2506.18082"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:01:22.612704Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.612704Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e62e35f03dd8e085bf18fabb1c5a154ba68c1c82b1968f7b4640272871439f81","observation_id":"73934b5a-b8bd-4fad-9184-f14341d7d33b","resolution":{"observed_at":"2026-08-15T19:01:22.612704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.618735Z","title":"A learning algorithm for boltzmann machines","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.618735Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:417158fa216ec6f8ad962f58705967c871c1aeb6add06e0488245d518d7072d0","observation_id":"047cc169-9748-4ac8-8dd0-afd73b65e784","resolution":{"observed_at":"2026-08-15T19:01:22.618735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07166","last_updated":"2025-02-11T01:20:32Z","snapshot_observed_at":"2026-08-15T07:01:40.834660Z","submitted_at":"2025-02-11T01:20:32Z","title":"Bayesian Optimization for Building Social-Influence-Free Consensus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07166","snapshot_observed_at":"2026-08-15T19:01:22.623798Z","title":"Bayesian optimization for building social-influence-free consensus","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.623798Z"},"links":{"cited_paper":"/paper/2502.07166","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:1b8aa99d5c0bbaf6790f6837e2ad838a3e0c1c609a12521a54440a2bff6c0796","observation_id":"3d5a76c7-339b-4488-b6d2-3deb50423093","resolution":{"observed_at":"2026-08-15T19:01:22.623798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.629098Z","title":"Jointly measuring diversity and quality in text generation models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.629098Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:cdf03c77d039d554b18dc3dee26eac5d5839cd7cb8cbf35ef8b51b1ad93388af","observation_id":"bd10c74c-bbdc-4b18-9328-500dd98a5989","resolution":{"observed_at":"2026-08-15T19:01:22.629098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15604","last_updated":"2026-08-06T08:45:18Z","snapshot_observed_at":"2026-08-18T11:08:10.828186Z","submitted_at":"2024-05-24T14:38:11Z","title":"Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15604","snapshot_observed_at":"2026-08-15T19:01:22.634347Z","title":"Text generation: A systematic literature review of tasks, evaluation, and challenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.634347Z"},"links":{"cited_paper":"/paper/2405.15604","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:eb4a8b4c5175647048230c2e5f303409fd8ec1f61964f7f024af29640254920e","observation_id":"6c93fbea-aa3e-477e-b6c0-6075fae97fbc","resolution":{"observed_at":"2026-08-15T19:01:22.634347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.639624Z","title":"Howcroft","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.639624Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e44d5c73baa36ecc643ae9b4afd51bbebd431d76f18be97f62bfad4b7935e591","observation_id":"6ab273dd-3369-4e8b-8c2c-519065bcb098","resolution":{"observed_at":"2026-08-15T19:01:22.639624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.645123Z","title":"Time for a change: a tutorial for comparing multiple classifiers through bayesian analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.645123Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:1c1dead1809938220052368cb3c48b359db38bad19fd4b00576ecbe9cc4afc3a","observation_id":"d80f3a6b-10a5-4745-abef-2f56854447b3","resolution":{"observed_at":"2026-08-15T19:01:22.645123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.649563Z","title":"Estimating the replication probability of significant classification benchmark experiments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.649563Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:2cf79dd902555bcbd90f1f9e87e75f25ca35cf63bd7a9ecb0d5e048734db3493","observation_id":"be63f9a0-102e-48ad-ad99-ea2ee7f1b679","resolution":{"observed_at":"2026-08-15T19:01:22.649563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.654122Z","title":"Comparing machine learning algorithms by union-free generic depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.654122Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:768ddac42c241f96477151eb628e984f6357eda5a811089a20aeb9270595720a","observation_id":"180392b0-bcbb-4614-b21d-5cc702d4a68f","resolution":{"observed_at":"2026-08-15T19:01:22.654122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20917","last_updated":"2024-07-30T15:54:18Z","snapshot_observed_at":"2026-08-16T13:29:49.778098Z","submitted_at":"2024-07-30T15:54:18Z","title":"How to Choose a Reinforcement-Learning Algorithm","version":1},"cited_work":{"arxiv_id":"2407.20917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20917","snapshot_observed_at":"2026-08-15T19:01:23.493219Z","title":"How to Choose a Reinforcement-Learning Algorithm","venue":"cs.LG","work_id":"740ecb97-f029-432d-b18b-1652aaf5f45b","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.659145Z"},"links":{"cited_paper":"/paper/2407.20917","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:b63e80f76c9747f21271ac2faea64dcaec0b8745453c8e789cfe779ef8ec8e20","observation_id":"7fd33ca0-421c-428a-b184-435ac2a8c915","resolution":{"observed_at":"2026-08-15T19:01:23.498287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.664456Z","title":"Self-learning from pairwise credal labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.664456Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:062183a88b9db811822bc052273a64935da0bda95327c8b81ac2b505ebb04bcd","observation_id":"2f2a6f9b-d7d4-4e06-85b5-1e658d827352","resolution":{"observed_at":"2026-08-15T19:01:22.664456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09656","last_updated":"2024-10-22T15:36:34Z","snapshot_observed_at":"2026-08-16T15:54:16.884510Z","submitted_at":"2023-02-19T19:03:26Z","title":"Credal Bayesian Deep Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09656","snapshot_observed_at":"2026-08-15T19:01:22.668977Z","title":"Credal bayesian deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.668977Z"},"links":{"cited_paper":"/paper/2302.09656","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:227097b050755548f095a8696dc20d09c0a3859f9dd4fc52732a255263363266","observation_id":"06115b3f-35d0-41a9-92d9-a41461efc11c","resolution":{"observed_at":"2026-08-15T19:01:22.668977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14799","last_updated":"2021-05-18T07:04:41Z","snapshot_observed_at":"2026-08-13T22:18:30.189974Z","submitted_at":"2020-06-26T04:52:48Z","title":"Evaluation of Text Generation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14799","snapshot_observed_at":"2026-08-15T19:01:22.674048Z","title":"Evaluation of text generation: A survey, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.674048Z"},"links":{"cited_paper":"/paper/2006.14799","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4787228423e80fbc6f991565c1bfdbaeb9997dd34f98353feb8b153e55291eba","observation_id":"a7374a2e-e032-4ad9-b368-1b027ee2837b","resolution":{"observed_at":"2026-08-15T19:01:22.674048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14614","last_updated":"2024-09-23T10:46:48Z","snapshot_observed_at":"2026-08-16T13:32:36.815875Z","submitted_at":"2024-07-19T18:13:37Z","title":"Evaluating language models as risk scores","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14614","snapshot_observed_at":"2026-08-15T19:01:22.679008Z","title":"Evaluating language models as risk scores","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.679008Z"},"links":{"cited_paper":"/paper/2407.14614","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4aca2abd92746cdb26385e4806af574f6940421e80add1039f15e1f055403a7c","observation_id":"37a75dca-7e3d-4efb-968e-8ccfe098d594","resolution":{"observed_at":"2026-08-15T19:01:22.679008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.684349Z","title":"Dem s ar","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.684349Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4256ee8d704a5198337a155f4fe141303acb2f647929d2a2090b5314323b9702","observation_id":"de2d369e-ba1e-41c7-83f6-96f86b9678c6","resolution":{"observed_at":"2026-08-15T19:01:22.684349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.365439Z","title":"Semi-supervised learning guided by the generalized bayes rule under soft revision","venue":null,"work_id":"0bdf8af3-7fe3-409c-bfa0-0e47f73550fd","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.688853Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:01fdf498b193199cac229056f1561debf19ec7f7149273a1e97bb8d6a59b57de","observation_id":"48152cc6-be62-424b-90c2-7df5bd442a12","resolution":{"observed_at":"2026-08-15T19:01:24.370372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.350324Z","title":null,"venue":null,"work_id":"d41182e8-0e4d-48e8-a607-8655e7af54e1","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.693271Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:62c0c74de40435a39213880a43196b6f43cf4c2a3daf20ba25950ea65c4f67aa","observation_id":"50948c9c-2caf-48cc-89a4-cd79f0608d6f","resolution":{"observed_at":"2026-08-15T19:01:24.355254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.334270Z","title":"Eugster, T","venue":null,"work_id":"0165a5cc-862d-4650-ae96-52435109853c","year":2012},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.699076Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:66c6815b5350c315c277234a4fbbf2268d71ebe99c6eb7863c2ff14b6ecaebc8","observation_id":"5d176290-587d-4e28-8a29-41249b8a12a9","resolution":{"observed_at":"2026-08-15T19:01:24.340072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.319145Z","title":"Hierarchical neural story generation, 2018","venue":null,"work_id":"1b80e80f-d7df-4937-a961-05683429584f","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.703565Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:3d167066b5c40dc0f29c8def943bf726824351d04efb471f538f84fba6b9ad40","observation_id":"0b2b8622-edac-4319-8f46-9928f3308b49","resolution":{"observed_at":"2026-08-15T19:01:24.323904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.708202Z","title":"Beam search strategies for neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.708202Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:cff97a25639a7fe4955291314566382149ae3920e35aa2e47dba99cf8fa51bc4","observation_id":"a470a5ca-8b39-47e1-9cfa-ce2230e1f604","resolution":{"observed_at":"2026-08-15T19:01:22.708202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.712984Z","title":"Simcse: Simple contrastive learning of sentence embeddings, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.712984Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:bded2f848fa54902fcaadd20ff0c95d0fc58f3982edc8c3517747b2a711f1999","observation_id":"502d7b1d-5c40-4a6f-8b77-93039ee13f03","resolution":{"observed_at":"2026-08-15T19:01:22.712984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18698","last_updated":"2024-10-21T08:43:41Z","snapshot_observed_at":"2026-08-16T13:30:47.810620Z","submitted_at":"2024-07-26T12:23:54Z","title":"Adaptive Contrastive Search: Uncertainty-Guided Decoding for Open-Ended Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18698","snapshot_observed_at":"2026-08-15T19:01:22.717493Z","title":"Adaptive contrastive search: Uncertainty-guided decoding for open-ended text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.717493Z"},"links":{"cited_paper":"/paper/2407.18698","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:9d531741cecaffc941e867b9d9c05b63af0f904dd5641c366ecfe4ee54f0301c","observation_id":"c70d8371-79a8-4660-aed6-08e2de291b8b","resolution":{"observed_at":"2026-08-15T19:01:22.717493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.290776Z","title":"Decoding decoded: Understanding hyperparameter effects in open-ended text generation","venue":null,"work_id":"e525dbf8-259f-4da0-a064-fa35f497bfc4","year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.722044Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:7ab91ab250a863def264238faaffe2b644add96e187e6b8ed87bf3c99cb44ba9","observation_id":"809d74bb-aed3-46c0-b02c-1d76cb139846","resolution":{"observed_at":"2026-08-15T19:01:24.295768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18653","last_updated":"2025-06-17T17:41:07Z","snapshot_observed_at":"2026-08-18T08:58:23.385315Z","submitted_at":"2024-10-24T11:32:01Z","title":"Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework","version":3},"cited_work":{"arxiv_id":"2410.18653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18653","snapshot_observed_at":"2026-08-15T19:01:23.401358Z","title":"Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework","venue":"cs.CL","work_id":"cab31625-7777-4d8c-9ebf-ab5c8f12e7c8","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.726512Z"},"links":{"cited_paper":"/paper/2410.18653","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:f86306a7c881b94bf1901f1fa338d0d392adfe795c61a63d79f1e93936d54234","observation_id":"41b2dbed-66f3-4aca-8dca-3aeb8f0d9da1","resolution":{"observed_at":"2026-08-15T19:01:23.406919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.275589Z","title":"Garc \\'i a and F","venue":null,"work_id":"6ac01ea8-cd7b-4933-bdb6-d599f88e919a","year":2008},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.731330Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:b1e6d74511835880cbf4170f4871cf959218c2fdf2f65015c151b4837353f954","observation_id":"47b56d44-0696-4371-ae7c-de8d090e9441","resolution":{"observed_at":"2026-08-15T19:01:24.280452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.261281Z","title":"García, A","venue":null,"work_id":"80887220-c2bf-429b-938f-978ddc5544bc","year":2010},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.736083Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6217bec4e684ab622fb5df7753d8cf4b762ff495c193cac2429f7cb2e28dcf11","observation_id":"98af811d-5f3d-42e5-8310-aefcfe993338","resolution":{"observed_at":"2026-08-15T19:01:24.266075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T19:01:22.740637Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.740637Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:68d68c3243fbf39d3526ad6906332e00a5827c7b7bd0536f4116d6875d517cd9","observation_id":"847f3e74-df78-4e72-835d-c74db774bf9d","resolution":{"observed_at":"2026-08-15T19:01:22.740637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:01:22.745434Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.745434Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:a17354413cf385af028d1d69b13ea3143533f37bac48960ac281ccfe70399eed","observation_id":"62970aa5-b0fd-448e-87e5-f8fdbb56fd96","resolution":{"observed_at":"2026-08-15T19:01:22.745434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02792","last_updated":"2019-04-04T21:03:34Z","snapshot_observed_at":"2026-08-16T03:04:17.238046Z","submitted_at":"2019-04-04T21:03:34Z","title":"Unifying Human and Statistical Evaluation for Natural Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02792","snapshot_observed_at":"2026-08-15T19:01:22.749990Z","title":"Hashimoto, Hugh Zhang, and Percy Liang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.749990Z"},"links":{"cited_paper":"/paper/1904.02792","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:037710b40f96de8bdfea4935d3578f8b16fd170616c1d77628149a924cf7fc4f","observation_id":"f06a955f-23d7-49ff-9010-f1e8e2bd8cf0","resolution":{"observed_at":"2026-08-15T19:01:22.749990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-15T19:01:22.755057Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.755057Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:c9766da3ba77c32a43c06cdb47ca21afe902b616d7ac16c044103c822cfc0a15","observation_id":"d9a87aa2-064c-415d-845c-7fab3f7e4763","resolution":{"observed_at":"2026-08-15T19:01:22.755057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.246031Z","title":"Hothorn, F","venue":null,"work_id":"de64451a-8ae0-4ab0-b875-ecc0d06cdb0d","year":2005},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.760019Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:f9c325cf395f94458c7615126a124d839ff838cf3121bf26e110060f10cd1ba8","observation_id":"3eb4cdf9-2109-46e9-8d61-42e0b965f71d","resolution":{"observed_at":"2026-08-15T19:01:24.250826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.764669Z","title":"Open graph benchmark: Datasets for machine learning on graphs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.764669Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:98af48e131eb3e1dad5b16da09f1bbed91b44baf72f52487b4b0779b6ab94658","observation_id":"482aa6f5-0bbe-4eb1-950c-6434c19dd408","resolution":{"observed_at":"2026-08-15T19:01:22.764669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.220331Z","title":null,"venue":null,"work_id":"6cedbae0-0b19-4883-8e8d-dabb59ffd9e8","year":1981},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.768921Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:68389d1b6ecb981d5b1a70798ee16c621539ecbe98ae5df5a4953cfca1d8c828","observation_id":"d4c2c78a-1f2f-4702-83eb-305930651da5","resolution":{"observed_at":"2026-08-15T19:01:24.225154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.203710Z","title":"Jansen, G","venue":null,"work_id":"c2436a80-3219-4393-9df7-f2af764e21ca","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.773521Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:b5857e954405fd2f403b948dd6faeb0ab3dfab03eac29f8fcfb5b8c00732442e","observation_id":"d6245343-16f7-468b-be3d-58c25aa7a060","resolution":{"observed_at":"2026-08-15T19:01:24.208171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.186644Z","title":"Jansen, H","venue":null,"work_id":"3155e4f9-d80f-4953-92bf-d2cb7c2fba51","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.777980Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:88f5deb27cd4a1a3c74a343b7caa0d924128e6bc31d0b057f8a357de7a5e4d8c","observation_id":"7f5a2312-0e66-4ddb-a436-6c2159c36e4e","resolution":{"observed_at":"2026-08-15T19:01:24.191725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10195","last_updated":"2025-01-17T13:39:51Z","snapshot_observed_at":"2026-08-18T15:45:58.189030Z","submitted_at":"2025-01-17T13:39:51Z","title":"Contributions to the Decision Theoretic Foundations of Machine Learning and Robust Statistics under Weakly Structured Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10195","snapshot_observed_at":"2026-08-15T19:01:22.782509Z","title":"Contributions to the decision theoretic foundations of machine learning and robust statistics under weakly structured information, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.782509Z"},"links":{"cited_paper":"/paper/2501.10195","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:cb93991d9f4261e5e45ce8715df423daec49045d098826ac997105615a15ac15","observation_id":"abde3ebb-d0fc-4b16-872b-7c4b2e5a2439","resolution":{"observed_at":"2026-08-15T19:01:22.782509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.169993Z","title":"Statistical comparisons of classifiers by generalized stochastic dominance","venue":null,"work_id":"5032e47b-7bdf-4bde-83fb-931f47d6889c","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.787435Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:c5f7b29e8745cf692f833717127d425d8b8e87a45567485fb78ab904c313c77e","observation_id":"0d9394e2-1fc2-49d7-a269-ea2bb814f8ad","resolution":{"observed_at":"2026-08-15T19:01:24.175823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.154026Z","title":"Multi-target decision making under conditions of severe uncertainty","venue":null,"work_id":"4b30e8ec-07d3-4851-bcf9-4974490f5cd3","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.792086Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:221e03f53b185291db0c7ada53e048a2f8a7f30baec1fc528a13e2c066425dc8","observation_id":"ee6a52ff-a88f-4ff5-9a52-0ef5ac3231dc","resolution":{"observed_at":"2026-08-15T19:01:24.158971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.138623Z","title":"Robust statistical comparison of random variables with locally varying scale of measurement","venue":null,"work_id":"fc0dad15-681a-404d-b78d-37c5ca3293f8","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.796599Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:70868e3bafa4520057b662014f56b1d23de9a45b818bb0d3e8acc5e1550bd013","observation_id":"9478c78a-6f67-461b-8abc-620cc3c3064c","resolution":{"observed_at":"2026-08-15T19:01:24.143662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.121687Z","title":"Statistical multicriteria benchmarking via the GSD -front","venue":null,"work_id":"8c39d409-ca80-464c-8bc7-009884474404","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.801334Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:32ab66dfe47072fcc4cb3c561f816fc8139db2d72e1abf1fedd72f6c00bcd0cd","observation_id":"2e7b3895-f8a9-44d8-9276-bcecca37765b","resolution":{"observed_at":"2026-08-15T19:01:24.126866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.805751Z","title":"Jelinek, R","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.805751Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:2a02f4f779292825f4f53dade86adc1d9d29210cdaec02b0ae34ea4f14eb749d","observation_id":"47d7e42a-b273-4d21-9b91-4c51e05154ad","resolution":{"observed_at":"2026-08-15T19:01:22.805751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.100342Z","title":"The prism alignment dataset: What participatory, representative and individualised human feedback reveals about the subjective and multicultural alignment of large language models","venue":null,"work_id":"8f7e129e-252d-4184-adf0-1c61fdd99504","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.810810Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:3493e0554add981ff31473e77d61b2f701f7edd1a2ab18f252ef834f9cedc353","observation_id":"405d4636-93bb-47fd-989a-03089d3a33a9","resolution":{"observed_at":"2026-08-15T19:01:24.106718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.079371Z","title":"Efficient multi-criteria optimization on noisy machine learning problems","venue":null,"work_id":"219be6f1-29c2-4dc2-aa4e-c4175d8eaeed","year":2015},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.815635Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:b4aa462e8ff92403c194e7f88fb82e61e44097364cfc937dbcdd6e0281f067ff","observation_id":"552b9996-ea13-499c-9877-1c36bc3abfd1","resolution":{"observed_at":"2026-08-15T19:01:24.084317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.063147Z","title":"Towards quantifying the effect of datasets for benchmarking: A look at tabular machine learning","venue":null,"work_id":"9a8d12b9-c182-4f4c-968b-cb710a8f711a","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.820250Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:e52ffcac8ababdfa54022516173ea831d237b51af2bf819f14bebee43a917514","observation_id":"ad91afc2-cd04-4249-8be3-23b5cd9e65f1","resolution":{"observed_at":"2026-08-15T19:01:24.068837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.046230Z","title":"Accelerated experimental design using a human-ai teaming framework","venue":null,"work_id":"25a4577d-2cf1-49e5-940d-ac8877ab2463","year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.825117Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:a30d5087369e44fba931d6c6994a8e789f52ffa8f1ecbe3e81d3475cb9067acc","observation_id":"7e220059-a974-498a-bdc9-bd69afd6e9f9","resolution":{"observed_at":"2026-08-15T19:01:24.051460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.024759Z","title":"Factuality enhanced language models for open-ended text generation","venue":null,"work_id":"c1d30598-16ce-44d0-98c7-bd70c02bcf91","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.829565Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4f04f1be6241b4cb9a19ffb1c577fb535cd9e647320c0fd646d2bbcd4bb34c0b","observation_id":"8363a457-cb5f-41f4-8e89-a1f6dc33daab","resolution":{"observed_at":"2026-08-15T19:01:24.030793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:24.004040Z","title":"A diversity-promoting objective function for neural conversation models","venue":null,"work_id":"88d6d15b-e612-48cc-8a09-d7d9f36fce30","year":2016},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.834159Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:763bac25bdf464a41f233d1078d05577e132cb4b8061d5e847efe94fc082d2cd","observation_id":"94544a59-e947-480a-8e71-1e8d656d5c9e","resolution":{"observed_at":"2026-08-15T19:01:24.010099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.839032Z","title":"Contrastive decoding: Open-ended text generation as optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.839032Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:243f43b97f8b1a4233928047d48c9dd18011278f8f0af1aba27b4683df717cce","observation_id":"57e6a772-cc2b-407d-b354-7fa7a9464712","resolution":{"observed_at":"2026-08-15T19:01:22.839032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-16T13:42:51.314941Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-15T19:01:22.843911Z","title":"Quantifying variance in evaluation benchmarks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.843911Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6cb22f1121f27cd210ba8d4d8cf3a5f3b2e8ced2da2d9c48124b2bb1e5ea0683","observation_id":"875b34cc-8ac6-4733-9fe6-ab580adcc110","resolution":{"observed_at":"2026-08-15T19:01:22.843911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.849573Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.849573Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:72fa78280cec1837ca4443970c5c28c2d7f46b780eea2abb6593e5502c6b0c78","observation_id":"8993ba60-1552-4443-8894-7bb642e477e4","resolution":{"observed_at":"2026-08-15T19:01:22.849573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.962673Z","title":"Mersmann, M","venue":null,"work_id":"399180f1-2cf5-4b67-9806-a07b3a656201","year":2015},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.854610Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:1143ea33727181e579e471a75302be12cc9a62dc405e90e78759972c9f654149","observation_id":"cecee8ff-15b0-4016-a5c2-1b9d7fb8f91e","resolution":{"observed_at":"2026-08-15T19:01:23.967599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.948459Z","title":"Meyer, F","venue":null,"work_id":"6225f23b-fe21-43ac-a893-f3e078dab02a","year":2003},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.859368Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:9d7d9ad6e941ebb4922146d712de8d5e02fce9339def5975464ca9873eb8d35b","observation_id":"f3b8f4af-bcea-4658-8d44-d31cd6c37a8b","resolution":{"observed_at":"2026-08-15T19:01:23.953009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.932867Z","title":"Learning de-biased regression trees and forests from complex samples","venue":null,"work_id":"cf0444da-2cd8-476a-9c14-b7b02e1953fe","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.863706Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:48a1e485460ebbe1f9861fb1c565e882ebeffc7adcb60ea6ca585a8b48ced6a2","observation_id":"006789af-20db-4f85-9519-c68d78d8394c","resolution":{"observed_at":"2026-08-15T19:01:23.937613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.916319Z","title":null,"venue":null,"work_id":"c90bffcd-6941-4ac1-950a-fe4dbaa0ad83","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.868285Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:716227cc43b5cb968171a517280be86af6307bed1a8fa111afb12538e5fdf430","observation_id":"d32f776c-4f0f-494a-b456-b7912e58b482","resolution":{"observed_at":"2026-08-15T19:01:23.921306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.900188Z","title":"Mauve: Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"196f5dd1-18e5-402e-b119-a6a260ca7804","year":2021},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.872613Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:fc6d1372d5a8c3459e22d9399b96271ea12985f828462022e09d13a30ae513e4","observation_id":"5fd61fd8-57aa-4927-b217-4cdf03e943ec","resolution":{"observed_at":"2026-08-15T19:01:23.905053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.876746Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.876746Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:2e1bcf53815cfea76e18d5d96171eeb44882662976fbd857e873ccc85ce02274","observation_id":"30056779-8cec-45f2-b62c-1190e981c105","resolution":{"observed_at":"2026-08-15T19:01:22.876746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.873991Z","title":"Partial rankings of optimizers","venue":null,"work_id":"c57e368b-b4bd-4e87-b1b7-63c3c9416641","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.881040Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:bd4701456df8e7775ec19a99e4ba1f89247e496ddb6e352c68426ba09c6af801","observation_id":"dd83a02d-229d-417e-a2c9-46d02366bcf8","resolution":{"observed_at":"2026-08-15T19:01:23.879394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.857387Z","title":"Levelwise data disambiguation by cautious superset classification","venue":null,"work_id":"712f6f9d-6504-411f-ac41-ed27bf809a75","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.885608Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:34eabe9a3497c3c6c04591aab43f1268172947caddb5bcc7ce98a913d58b4152","observation_id":"c5a11e91-667c-4885-b3d2-382221ab37b1","resolution":{"observed_at":"2026-08-15T19:01:23.862698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.841805Z","title":"Approximately bayes-optimal pseudo-label selection","venue":null,"work_id":"82db6367-648c-4427-ba86-8f583fbd7fdb","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.890326Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:17442257a24fbc2258a8fffc3b1a295c059c890d8a1c384dfa552d5770614371","observation_id":"e07be0ab-dc50-4d13-9a55-4209ff7d99e0","resolution":{"observed_at":"2026-08-15T19:01:23.846974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.825946Z","title":"In all likelihoods: Robust selection of pseudo-labeled data","venue":null,"work_id":"42ab9b58-4506-462a-81c7-e16452936994","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.894647Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:75f0631a5b47e92510874b42ae67fac46d900f6a867734478eb4bc9ff51b55cb","observation_id":"75b9fd2e-c80a-47e0-abcb-a0e83b233fd3","resolution":{"observed_at":"2026-08-15T19:01:23.830638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04629","last_updated":"2024-03-08T07:52:32Z","snapshot_observed_at":"2026-08-18T15:47:41.172547Z","submitted_at":"2024-03-07T16:13:32Z","title":"Explaining Bayesian Optimization by Shapley Values Facilitates Human-AI Collaboration","version":2},"cited_work":{"arxiv_id":"2403.04629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04629","snapshot_observed_at":"2026-08-15T19:01:23.275656Z","title":"Explaining Bayesian Optimization by Shapley Values Facilitates Human-AI Collaboration","venue":"cs.LG","work_id":"191dd38c-fcd1-4ec7-a4ef-1548e020a854","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.899482Z"},"links":{"cited_paper":"/paper/2403.04629","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:00e832a971fb27532b82c340e6b98a0774bc0a6b50aaf98c5e07fe3ae2092d6a","observation_id":"5b254428-beea-4c10-9932-a0170c11af7b","resolution":{"observed_at":"2026-08-15T19:01:23.280879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14581","last_updated":"2025-05-12T09:51:39Z","snapshot_observed_at":"2026-08-18T04:58:47.396246Z","submitted_at":"2025-02-20T14:12:18Z","title":"A Statistical Case Against Empirical Human-AI Alignment","version":2},"cited_work":{"arxiv_id":"2502.14581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14581","snapshot_observed_at":"2026-08-15T19:01:23.251631Z","title":"A Statistical Case Against Empirical Human-AI Alignment","venue":"cs.AI","work_id":"ecb3cbbc-7ae6-4d17-867b-438db7205e57","year":2025},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.904326Z"},"links":{"cited_paper":"/paper/2502.14581","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:abc0ed797a09a14f837a281fba927d411dfeaee721fe47f228710f25ee51423d","observation_id":"7053843b-859e-4f0e-bdc4-214a69dae1a9","resolution":{"observed_at":"2026-08-15T19:01:23.257694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.811267Z","title":"A meta-analysis of overfitting in machine learning","venue":null,"work_id":"0dc52f4f-6a90-4a5c-92ca-81b07ebe9e39","year":2019},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.909152Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:9a182f71c2ad8bf9e3ca2e69d3ca19c54979a5948f6235abe1fb3daf1065239e","observation_id":"e1478825-dbcd-4ec9-86c8-772f9d969d6d","resolution":{"observed_at":"2026-08-15T19:01:23.815993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.794611Z","title":"Schneider, L","venue":null,"work_id":"3a07c2fb-2fa0-42e0-8e74-427dd67d5c76","year":2018},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.913529Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:21960ca59a6a94eb01b30a03c95e1cf7efb110f6f0a9c5bc0aaff8afd3e2d957","observation_id":"8c2823b6-54a7-4337-b4fc-06440b25f108","resolution":{"observed_at":"2026-08-15T19:01:23.800614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.776524Z","title":"A minimax learning approach to off-policy evaluation in confounded partially observable markov decision processes","venue":null,"work_id":"12e99164-c288-4154-bee2-26da16de92aa","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.918228Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:8cd14756b552cfe8e62f433634d976731927371f8840a1d238c69abd98107834","observation_id":"96a68390-0e70-4846-8512-f23487770614","resolution":{"observed_at":"2026-08-15T19:01:23.781777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.758669Z","title":"Shirali, R","venue":null,"work_id":"a0bd47e0-2be4-4936-b04e-8ded889bb487","year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.922919Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:f02ff8a0b626483596417d5777545ca8f0a1a1b365d08d9c8087615e85f67a2b","observation_id":"c232a105-626a-44e4-a2d6-a8d84a0dc1c4","resolution":{"observed_at":"2026-08-15T19:01:23.764739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.741915Z","title":"An empirical study on contrastive search and contrastive decoding for open-ended text generation, 2022","venue":null,"work_id":"b93fd79e-4984-4308-9dab-5ea2723531d6","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.927214Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:711ace168c21207cbf4283137cb0153a7a1821c502d989c5fbeca70b48c7b4c7","observation_id":"e0938fbb-fa31-4e29-95c0-98b183dd0140","resolution":{"observed_at":"2026-08-15T19:01:23.746915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.724572Z","title":"A contrastive framework for neural text generation, 2022","venue":null,"work_id":"2d145a4d-5e00-4db3-a937-12b31121c071","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.931636Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:902e8abca35cf6a929e7530c498f0f0eac8eb8a99a0a2222bb968b50770d61f3","observation_id":"8aa759bd-0119-472c-9ecb-b54d50bca22e","resolution":{"observed_at":"2026-08-15T19:01:23.730152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.708086Z","title":"Evaluating the evaluation of diversity in natural language generation","venue":null,"work_id":"03f49f6f-be35-4322-ad11-1e039ca64d96","year":2021},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.935910Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:2265d950b4dd25c57eb21f20bdc53351b7896e262c5fca7b39645d56907dfe5e","observation_id":"8d2b3088-51e4-4876-91a8-b01909cd9031","resolution":{"observed_at":"2026-08-15T19:01:23.713796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.691519Z","title":"Scientific machine learning benchmarks","venue":null,"work_id":"6378433f-5e76-4050-938a-21e91a5290d5","year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.940493Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:978cae989d69117021b381707279515241eb1c149daaa0e249fe556e54daf5b8","observation_id":"3f3b1e7d-5e75-4367-bc58-f7eac5178bc6","resolution":{"observed_at":"2026-08-15T19:01:23.696300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.944941Z","title":"Openml: networked science in machine learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.944941Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:6013425a36460a68e6263bb46de08c714adf240d55ff5d08cf1feaae24dfaabc","observation_id":"25df4b8e-684c-49ce-ae01-76e76555ceab","resolution":{"observed_at":"2026-08-15T19:01:22.944941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:22.949512Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.949512Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:bccaefabf801c357bb965ceb8f18fc960239cfdbda2a2a17a05e27f1ed7c24ce","observation_id":"688c6c05-f339-4aca-aea3-74751283f638","resolution":{"observed_at":"2026-08-15T19:01:22.949512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-15T19:01:22.954002Z","title":"Livebench: A challenging, contamination-free llm benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.954002Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:4d65c0920dff504efa3e33374cbab7dff89545a0195ec6323ca87d83b9d083a1","observation_id":"69419229-b8ae-4126-ae63-cd1742e20623","resolution":{"observed_at":"2026-08-15T19:01:22.954002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10452","last_updated":"2024-10-14T12:46:02Z","snapshot_observed_at":"2026-08-16T13:09:38.569470Z","submitted_at":"2024-10-14T12:46:02Z","title":"Principled Bayesian Optimisation in Collaboration with Human Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10452","snapshot_observed_at":"2026-08-15T19:01:22.958957Z","title":"Principled bayesian optimisation in collaboration with human experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.958957Z"},"links":{"cited_paper":"/paper/2410.10452","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:10a0cf1cb8d3814aea29fa2661e488c97f8474d5fccdd474ab8f208cef4ccfd9","observation_id":"79b025d7-184c-4c3c-8d74-3b23bac0e1bd","resolution":{"observed_at":"2026-08-15T19:01:22.958957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T19:01:22.964167Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.964167Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:524debbd2c2b679e7895fc80c30348efbdd22f0201e81ca9ae8ef6da75040cb8","observation_id":"02fad94f-8661-4f1e-a412-cf73f8c6bb4f","resolution":{"observed_at":"2026-08-15T19:01:22.964167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.652168Z","title":"Benchmarking llms via uncertainty quantification","venue":null,"work_id":"a5ff39ac-545f-4fab-b621-689d3fae2583","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.969120Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:9e2e69a2ec4a4d0b303542babe912553a3755c39cebb30db0494c8f8f9e3b330","observation_id":"9dd85e22-0986-42fd-9dd0-adf64cea4b89","resolution":{"observed_at":"2026-08-15T19:01:23.657388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.636795Z","title":"Zhang and M","venue":null,"work_id":"f77eba13-806c-429e-88f2-5f8a5ef69e67","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.973816Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:3fc30ebf5c1e3c7d2818a21a1f5b7549117d5edf414cee13f31f3c35633c7b2e","observation_id":"80df0dbc-876b-48e6-b825-c1c79dbccd9c","resolution":{"observed_at":"2026-08-15T19:01:23.641910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.620690Z","title":"Inherent trade-offs between diversity and stability in multi-task benchmarks","venue":null,"work_id":"513fde82-ade1-4ad6-9956-46435b06bbe4","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.978485Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:ae98bf68943434f652b00f3e67391fee72c7aab245ccf8c1389d2e42f75798e6","observation_id":"dee8534b-81d3-4281-b9c6-c88936471016","resolution":{"observed_at":"2026-08-15T19:01:23.626263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.601632Z","title":"Zhang, M","venue":null,"work_id":"0ec1d6f5-b151-49f3-834a-ff7214c5b60f","year":2020},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.982795Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:a1ec5480c7c532ce402698b9aa1a67f8667d88024c66bfe84f13151663095807","observation_id":"dcc7d216-632a-4d04-98b1-03c0e069dab1","resolution":{"observed_at":"2026-08-15T19:01:23.607704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T19:01:22.987507Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.987507Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:97f832f22db584a37918ac916c1bfebb06d49700ca2bf3118eaa00ee3c326852","observation_id":"bbbe07c5-3379-493f-b2b2-4478d742f342","resolution":{"observed_at":"2026-08-15T19:01:22.987507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-19T21:12:37.288621Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-15T19:01:22.992886Z","title":"Don't make your llm an evaluation benchmark cheater","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.992886Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:36528df8649c0822a78b8ea9929ba817ae28876a83a2443728a30a7e6998b12e","observation_id":"ce165ab0-9b6b-4fd7-b5c3-b509f1e98262","resolution":{"observed_at":"2026-08-15T19:01:22.992886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01632","last_updated":"2025-02-22T20:08:38Z","snapshot_observed_at":"2026-08-18T11:22:55.267515Z","submitted_at":"2024-02-02T18:52:16Z","title":"Time-Varying Gaussian Process Bandits with Unknown Prior","version":4},"cited_work":{"arxiv_id":"2402.01632","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01632","snapshot_observed_at":"2026-08-15T19:01:23.119457Z","title":"Time-Varying Gaussian Process Bandits with Unknown Prior","venue":"cs.LG","work_id":"b5f4cf31-a2fe-4da2-970f-b12712732685","year":2024},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:22.998385Z"},"links":{"cited_paper":"/paper/2402.01632","citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:ec20f7d8e3dae1e39d71ec6cd5b15b9304d593ec2961de72d8719695c37a47b1","observation_id":"84ec1c5f-a10f-4a70-aa16-4e7972dd720e","resolution":{"observed_at":"2026-08-15T19:01:23.127948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.004618Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.004618Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:bc798d3fa59f9dae4e147e60e51e1fea35d409345ca065133ec3f1565be00621","observation_id":"f055e5b2-a437-4db0-beb4-bd59ff17b15d","resolution":{"observed_at":"2026-08-15T19:01:23.004618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.010839Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.010839Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:31e7eaf87465f394df9cdc8674c2e2b726a323c18d8377428603f23c155ade01","observation_id":"937452c5-e766-4b61-a551-55a656f248d4","resolution":{"observed_at":"2026-08-15T19:01:23.010839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.017499Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.017499Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:5bf527bf56018fb11b08ce36024f43fa1f7457b02773fe588a63eacc418a8739","observation_id":"85b98448-6d2f-48b0-85f8-7259e64911d8","resolution":{"observed_at":"2026-08-15T19:01:23.017499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:01:23.023749Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T19:01:23.023749Z"},"links":{"citing_paper":"/paper/2506.18082"},"observation_digest":"sha256:581ba31225d4f56056539436a0f6e9c4b5ea30fc9daae2726d215acce057830c","observation_id":"07c14cbb-1a00-47ed-a09a-6fc1bb80fc65","resolution":{"observed_at":"2026-08-15T19:01:23.023749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18082","last_updated":"2025-06-24T07:59:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T02:33:19.313737Z","submitted_at":"2025-06-22T16:08:44Z","title":"Statistical Multicriteria Evaluation of LLM-Generated Text"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":5,"verified_fuzzy":39},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2506.18082."}